视觉智能开放平台

首页 标签 视觉智能开放平台
阿里云视觉智能开放平台--文字识别使用教程
文字识别技术是基于阿里云深度学习技术,为您提供通用的印刷文字识别和文档结构化等能力。文字识别技术可以灵活应用于证件文字识别、发票文字识别、文档识别与整理等行业场景,满足认证、鉴权、票据流转审核等业务需求。
带你读《深度学习与图像识别:原理与实践》之一:机器视觉在行业中的应用
这是一部从技术原理、算法和工程实践3个维度系统讲解图像识别的著作,由阿里巴巴达摩院算法专家、阿里巴巴技术发展专家、阿里巴巴数据架构师联合撰写。在知识点的选择上,本书广度和深度兼顾,既能让完全没有基础的读者迅速入门,又能让有基础的读者深入掌握图像识别的核心技术;在写作方式上,本书避开了复杂的数学公式及其推导,从问题的前因后果 、创造者的思考过程,利用简单的数学计算来做模型分析和讲解,通俗易懂。更重要的是,本书不仅仅是聚焦于技术,而是将重点放在了如何用技术解决实际的业务问题。
带你读《深度学习与图像识别:原理与实践》之三:图像分类之KNN算法
这是一部从技术原理、算法和工程实践3个维度系统讲解图像识别的著作,由阿里巴巴达摩院算法专家、阿里巴巴技术发展专家、阿里巴巴数据架构师联合撰写。在知识点的选择上,本书广度和深度兼顾,既能让完全没有基础的读者迅速入门,又能让有基础的读者深入掌握图像识别的核心技术;在写作方式上,本书避开了复杂的数学公式及其推导,从问题的前因后果 、创造者的思考过程,利用简单的数学计算来做模型分析和讲解,通俗易懂。更重要的是,本书不仅仅是聚焦于技术,而是将重点放在了如何用技术解决实际的业务问题。
video-subtitle-remover(VSR)--开源AI去字幕方案深度解析
VSR(video-subtitle-remover)是一款开源AI视频去字幕工具,支持本地运行,无需上传数据。它融合STTN、LaMa、ProPainter三大前沿修复模型,可智能检测并擦除硬字幕/水印,保持原分辨率与画质。兼容CUDA/DirectML,适配NVIDIA/AMD/Intel显卡,兼顾隐私性、可控性与高性能。
|
19天前
| |
来自: 视觉智能
DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说
DeepSeek V4-Pro正式版(0813)上线,Agent能力跃升:DeepSWE达62.7(+5×),Terminal Bench 87.9,逼近Claude Fable 5;输入3元/百万Token、输出6元,成本仅其约1/46,但所有跑分尚未经第三方验证。
|
19天前
| |
来自: 视觉智能
Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分
Grok 4.6是xAI于2026年8月发布的1.5万亿参数大模型,专注长程智能体任务,AI指数61分追平GPT-5.6 Sol;回合效率领先(仅需53步),定价$2/$6(百万Token),但超20万Token即翻倍。
免费试用