视觉智能开放平台的搜索结果_热门_第7页-阿里云开发者社区

提个问题

|

问答

|

来自：视觉智能

视觉智能开放平台文字识别API服务计费和报价

# 视觉智能开放平台 # 文字识别 # 文字识别 # API

阿里云OpenVI

|

博文

|

来自： ModelScope模型即服务

【OpenVI-图像超分实战篇】别用GAN做超分了，快来试试基于扩散模型的图像超分吧！

近10年来，深度学习技术得到了长足进步，在图像增强领域取得了显著的成果，尤其是以GAN为代表的生成式模型在图像复原、老片修复，图像超分辨率等方面大放异彩。图像超分辨率是视频增强方面，用于提升画质的典型应用。生成对抗网络GAN使得在图像分辨率增加的同时，保持细节特征，补充生成真实的纹理，其中应用广泛的工作是Real-ESRGAN。扩散模型DiffusionModel在图像超分辨率这方面的新的应用，展现出其超过GAN的生成多样性和真实性。看完后，你会发现，还在用GAN做图像超分辨率吗？已经OUT了，快来试试DiffusionModel吧！

# 视觉智能开放平台 # 机器学习/深度学习 # 编解码 # 达摩院 # 算法

蚝油菜花

|

博文

|

来自： ModelScope模型即服务

X-AnyLabeling：开源的 AI 图像标注工具，支持多种标注样式，适于目标检测、图像分割等不同场景

X-AnyLabeling是一款集成了多种深度学习算法的图像标注工具，支持图像和视频的多样化标注样式，适用于多种AI训练场景。本文将详细介绍X-AnyLabeling的功能、技术原理以及如何运行该工具。

# 视觉智能开放平台 # 机器学习/深度学习 # 人工智能 # 算法 # 计算机视觉 # 数据格式

蚝油菜花

|

博文

|

来自： ModelScope模型即服务

video-analyzer：开源视频分析工具，支持提取视频关键帧、音频转录，自动生成视频详细描述

video-analyzer 是一款开源视频分析工具，结合 Llama 的 11B 视觉模型和 OpenAI 的 Whisper 模型，能够提取视频关键帧、转录音频并生成详细描述，支持本地运行和多种应用场景

# 视觉智能开放平台 # 人工智能 # 自然语言处理 # 监控 # API # 计算机视觉

kuaitongai

|

博文

|

来自：视觉智能

分析对比大模型OCR、传统OCR和深度学习OCR

OCR技术近年来迅速普及，广泛应用于文件扫描、快递单号识别、车牌识别及日常翻译等场景，极大提升了便利性。其发展历程从传统方法（基于模板匹配和手工特征设计）到深度学习（采用CNN、LSTM等自动学习高级语义特征），再到大模型OCR（基于Transformer架构，支持跨场景泛化和少样本学习）。每种技术在特定场景下各有优劣：传统OCR适合实时场景，深度学习OCR精度高但依赖大量数据，大模型OCR泛化能力强但训练成本高。未来，大模型OCR将结合多模态预训练，向通用文字理解方向发展，与深度学习OCR形成互补生态，最大化平衡成本与性能。

# 视觉智能开放平台 # 机器学习/深度学习 # 文字识别 # 自然语言处理 # 异构计算

蚝油菜花

|

博文

|

来自： ModelScope模型即服务

STAR：南京大学联合字节开源视频超分辨率增强生成框架，视频清晰度一键提升，支持从低分辨率视频生成高分辨率视频

STAR 是由南京大学、字节跳动和西南大学联合推出的视频超分辨率框架，能够将低分辨率视频提升为高分辨率，同时保持细节清晰度和时间一致性。

# 视觉智能开放平台 # 机器学习/深度学习 # 编解码 # 人工智能 # 监控

老乡别走

|

博文

|

来自：视觉智能

【PDF提取全自动改名】如何批量提取PDF指定区域的文字内容，用内容批量给PDF命名或者导出表格，学会全自动解放双手

在生活和工作中，我们常需处理大量PDF文件，如银行单据、税收单据等。手动处理效率低下，而使用“咕嘎批量PDF多区域内容提取重命名导表格系统”可快速完成数千份文档的处理，大幅提高效率。该工具通过获取PDF各区域内容坐标，导入并处理文件，最终将信息提取至表格，并根据关键信息对PDF进行重命名，方便管理和查找。

# 视觉智能开放平台 # 文字识别

青城山下庄文杰

|

问答

|

来自： ModelScope模型即服务

请问去哪里找ModelScope里面各个模型的id？

# 视觉智能开放平台

三分钟热度的鱼

|

问答

|

来自：视觉智能

文字识别OCR体验了一下，识别不出来，麻烦帮我看下怎么解决？

# 文字识别 # 视觉智能开放平台 # 文字识别

嘟嘟嘟嘟嘟嘟

|

问答

|

来自：视觉智能

文字识别OCR目前有哪些情况会导致识别失败？

# 文字识别 # 视觉智能开放平台 # 文字识别

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

视觉智能开放平台