文字识别

首页 标签 文字识别
# 文字识别 #
关注
6088内容
RPA之眼:AI-OCR,Fax-OCR概述
文丨马磊 OCR是一种与RPA机器人协作的一项重要技术,相当于机器人的眼睛。 OCR是英文“Optical Character Recognition/Reader”的简称,光学字符识别。从名字我们不难看出,OCR就是读取手写和印刷文字,并把读取的信息转换成可以在电脑的Excel,World等软件上使用的文字信息处理技术。
2026企业AI如何真正落地?深度拆解60+全球案例
2026年企业AI应用已告别“大模型万能论”。本文基于斯坦福《企业AI实战手册》及16家头部企业案例,提炼7条落地共性:AI须嵌入核心业务流程;高风险行业坚持“人先于AI”;数据质量决定成效上限;行业分化加剧,通用方案失效;价值重心从个人提效转向组织决策;AI需持续运营而非一次性项目;推荐以8周闭环验证真实场景,本质是经营能力的竞争。
GitHub封锁?推荐5个国产的Git仓库替代平台
近日,GitHub对中国区IP的部分限制引发了广泛关注。未登录用户被拒,已登录用户功能受限,南北网络环境差异更显“内卷”。为应对这一挑战,本文推荐了多个国产Git平台:Gitee(码云)、GitCode(CSDN旗下)、CODING(腾讯系)、CodeUP(阿里云支持)及微信代码管理工具。这些平台功能全面、稳定性强,是开发者迁移项目的理想选择。通过同步代码、配置CI/CD流水线等简单步骤,可确保项目平稳过渡。此次事件提醒我们,掌握核心技能与支持国产平台同样重要!
|
1月前
| |
一文分清阿里云千问Qwen3.7 Max、Plus、Flash:能力差异与场景适配方案
2026年阿里云推出通义千问Qwen3.7完整产品矩阵,包含Max、Plus、Flash三款主力商用模型,三款模型统一标配100万Token超长上下文窗口、最长35小时连续自治执行能力,但在架构设计、模态支持、推理上限、响应速度、计费单价上存在显著区分,分别对应极致专业推理、多模态综合商用、轻量化高并发三类核心需求。本文依托官方实测基准数据,从基础硬件参数、综合能力、推理速度、计费成本、落地场景五大维度横向拆解,为个人开发者、中小企业、政企研发团队提供清晰选型依据,避免选型不当造成性能不足或算力成本浪费。
|
2月前
|
阿里云通义千问Qwen3.7怎么选?Max、Plus、Flash三大版本实测对比
阿里云通义千问Qwen3.7系列包含Max、Plus、Flash三大核心版本,三者定位清晰、能力互补,分别面向极致推理、多模态全能、轻量高效三大场景。三款模型共享100万Tokens超长上下文窗口与35小时自治执行上限,但在模态能力、架构设计、输出上限、推理速度与计费标准上存在本质差异。本文结合实测数据,从核心定位、基础参数、能力表现、成本性价比、场景适配五大维度,全面解析三大版本的区别,为个人与企业提供精准选型参考。
阿里云Qwen3.7-Plus简介:模型能力、适用场景、支持订阅计划与最新优惠
Qwen3.7-Plus是阿里云千问系列旗舰级多模态大模型,核心优势在于多模态交互混合智能体能力——可感知真实场景、操作GUI界面、基于视觉生成代码并端到端导航应用。模型支持1M tokens上下文、单图最高1600万像素、最长2小时视频输入,文本能力接近旗舰Max,视觉推理BabyVision得分较上代从37.4跃升至64.7,在Vision Arena榜单跻身全球前五、中国第一。目前已上线阿里云百炼,新人可免费试用100万tokens,推理服务限时8折(输入低至1.6元/百万tokens),适用于图像视频理解、智能体交互、OCR及自动化工作流等高阶场景。
如何利用OCR进行营业执照图片识别?
使用营业执照识别技术,实现对企业信息的结构化识别和录入,可应用于电商、零售、O2O等行业的商户入驻审查场景,实现商户信息的自动化审查和录入,有效提高客户体验,并大幅度提升服务标准和运营效率首先,激活使用权限,点此链接然后,进行在线调试看是否成功,如下图:返回数据如下: { "code": .
|
20天前
|
阿里云百炼知识库(Knowledge Studio):迈入 Agentic RAG 4.0时代
阿里云百炼Knowledge Studio(RAG 4.0)推出独立 Rag Agent服务,提供 Agentic Search + Agentic Generation 闭环方案。面向企业全模态多知识库场景,真正做到复杂知识搜得到、答得好、引用看得见。
免费试用