版式文字定位识别-图文文字坐标检测-可定位通用文字识别-含位置信息OCR识别API接口介绍

简介: 通用文字识别API支持多场景、多语种高精度OCR,输出文字内容、置信度、矩形及四点多边形坐标,完整还原版式布局,适用于文档电子化、智能排版等场景,支持URL、Base64、文件上传及PDF/OFD解析。

前言

支持多场景、多语种、高精度识别能力,在常规文字识别基础上,精准输出每行文字的完整识别内容、置信概率、坐标位置以及四点多边形坐标数据,完整还原原图排版布局,方便开发者完成版式还原、内容矫正、图文二次加工等精细化处理。

通用文字识别被广泛用于文档电子化、图文解析、智能排版、内容抓取等业务,擅长批量提取图片内有效文字内容。

核心能力

  • 支持 URL、Base64、文件三类图像上传途径,适配 JPG/PNG/BMP 等通用图片格式;
  • 适配文档、海报、截图、实拍图等各类通用场景图文识别,支持多语种内容精准解析;
  • 新增文字位置坐标输出能力,补齐普通OCR无法实现版式二次处理的短板;
  • 具备高精度文字检测能力,可完整抓取整图全部文本内容;

API介绍

请求说明

名称 类型 必须 说明
image String 图片base64
pdf String PDF文件的base64
pdfNum String 需要识别的PDF文件的对应页码,不传默认识别第 1 页
ofd String OFD文件的base64
ofdNum String 需要识别的OFD文件的对应页码,不传默认识别第 1 页
file String 文件
url String 文件地址

戳这里查看详情

返回样例

{
   
  "msg": "成功",// code 对应的描述
  "code": 200,// 详见code返回码说明
  "taskNo": "316942821199035820008485",// 本次请求号
  "data": {
   
    "resultNum": 2,//识别结果数
    "result": [//识别结果
      {
   
        "words": "测试第一行",//识别结果字符串
        "location": {
   //位置数组(坐标0点为左上角)
          "top": 72,//表示定位位置的长方形左上顶点的垂直坐标
          "left": 89,//表示定位位置的长方形左上顶点的水平坐标
          "width": 52,//表示定位位置的长方形的宽度
          "height": 12//表示定位位置的长方形的高度
        },
        "probability": {
   //表示识别结果中每一行的置信度值
          "average": 0.9956096411,//行置信度平均值
          "min": 0.9842295051,//行置信度最小值
          "variance": 0.00003516419747//行置信度方差
        },
        "vertexesLocation": [//识别结果中每一行的外包四边形点坐标
          {
   
            "x": 90,//水平坐标(坐标0点为左上角)
            "y": 73//垂直坐标(坐标0点为左上角)
          },
          {
   
            "x": 142,
            "y": 73
          },
          {
   
            "x": 142,
            "y": 85
          },
          {
   
            "x": 90,
            "y": 85
          }
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
   
            "x": 89,
            "y": 72
          },
          {
   
            "x": 101,
            "y": 72
          },
          {
   
            "x": 113,
            "y": 72
          },
          {
   
            "x": 124,
            "y": 72
          },
          {
   
            "x": 136,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 78
          },
          {
   
            "x": 141,
            "y": 84
          },
          {
   
            "x": 130,
            "y": 84
          },
          {
   
            "x": 118,
            "y": 84
          },
          {
   
            "x": 106,
            "y": 84
          },
          {
   
            "x": 95,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 78
          }
        ]

      },
    ],
    "paragraphsResult": [//段落检测结果
      {
   
        "wordsResultIdx": [//一个段落包含的行序号
          0,
          1
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
   
            "x": 89,
            "y": 72
          },
          {
   
            "x": 101,
            "y": 72
          },
          {
   
            "x": 113,
            "y": 72
          },
          {
   
            "x": 124,
            "y": 72
          },
          {
   
            "x": 136,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 84
          },
          {
   
            "x": 141,
            "y": 88
          },
          {
   
            "x": 141,
            "y": 100
          },
          {
   
            "x": 141,
            "y": 100
          },
          {
   
            "x": 129,
            "y": 100
          },
          {
   
            "x": 117,
            "y": 100
          },
          {
   
            "x": 104,
            "y": 99
          },
          {
   
            "x": 92,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 87
          },
          {
   
            "x": 89,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 72
          }
        ]

      }
    ],
    "paragraphsResultNum": 1,//识别结果数,表示 paragraphsResult 的元素个数
    "pdfFileSize": 1//传入PDF文件的总页数,当 pdfFile 参数有效时返回该字段
  }
}
相关文章
|
1月前
|
人工智能 API 数据安全/隐私保护
聚美智数 × 阿里云百炼One Key MCP:一个 API Key,连接海量 Agent 生态
阿里云百炼上线One Key MCP服务,仅需一个API Key即可统一调用全部MCP能力,兼容Codex、Claude Code等主流Coding Agent平台。聚美智数首批接入,首发车辆VIN、快递、物流轨迹查询服务,毫秒响应、合规权威,助力Agent快速集成真实业务能力。
172 0
聚美智数 × 阿里云百炼One Key MCP:一个 API Key,连接海量 Agent 生态
|
7月前
|
机器学习/深度学习 人工智能 API
证件照检测API接口的应用
在数字化时代,证件照质量直接影响身份认证等关键流程。自研合规证件照系统技术门槛高、成本大。本AI接口提供人脸检测、背景合规性分析等20+项智能审核,支持多格式输入与标准化返回,助力企业快速集成、降本增效。
324 1
|
6月前
|
API 知识图谱
快递预估价格查询-快递价格预估-快递价格查询-快递价格计算API接口介绍
快递价格预估API支持顺丰,京东,EMS,中通,圆通,申通,韵达,极兔,德邦等主流快递公司。输入起止地、重量体积,秒级返回预估运费。助力用户比价选最优方案(便宜/快速/上门),商家精准设置运费模板,避免亏损或流失客户。
679 0
|
2月前
|
API
菜谱查询-菜谱大全-家常菜谱查询API接口介绍
本菜谱API提供超十万条权威菜谱数据,支持按分类、关键词精准查询,返回菜名、步骤、配料及图片。适用于解决“吃什么”难题、新手学厨、营养搭配、特殊饮食需求及剩菜利用等场景,助力健康智慧烹饪。
163 0
|
2月前
|
JSON API 开发者
国际法定节假日查询-日历查询-节假日查询API接口介绍
节假日API,一站式获取法定假日、国际节日及传统节日信息!支持按年查询节假日列表,或按日期查询当日节日详情(含调休、简介等),返回结构化JSON数据。广泛适用于旅游、电商、OA、日历等场景,省去人工维护成本,提升开发效率与用户体验。
461 0
|
3月前
|
API 数据库
邮箱验证-邮箱校验-邮件地址验证-电子邮件地址校验接口介绍
本API提供邮箱验证服务,可快速检测邮箱格式、MX记录、是否为一次性邮箱等,有效提升邮件送达率、保护发件人信誉、降低营销成本、维护客户数据库准确性,助力企业高效精准触达真实用户。
192 1
|
3月前
|
API
三合一收款码-聚合收款码API接口介绍
本文介绍三合一收款码API,聚合微信、支付宝、QQ支付,一码兼容多渠道,解决多码杂乱痛点。支持自定义Logo、背景、样式等,适用于小微商户、街边摊等线下场景,大幅简化收银流程。
534 0
|
3月前
|
API
车型库查询-车型大全-车系大全-车型识别-汽车标志-车型车系-汽车品牌API接口介绍
本API提供全量车型库查询服务,支持按品牌→车系→车型三级检索,覆盖比亚迪、宝马等主流品牌及年款、排量、驱动、环保标准、指导价、配置参数等字段,广泛应用于汽车销售、保险与维修场景。
316 0
|
5月前
|
安全 API
广告敏感词过滤-敏感词-文本审核-敏感词过滤-敏感词检测
本工具提供文本合规检测服务,精准识别广告法违禁词、极限用语(如“顶级”“全网首发”)、色情低俗、辱骂攻击及低质灌水等内容,支持电商文案、短视频脚本、企业宣传物料等多场景审核,保障内容安全合规。
687 10
|
5月前
|
算法 API
翻拍识别-翻拍检测-图片翻拍识别-图像翻拍检测-图片造假检测API接口介绍
翻拍识别API可精准识别手机翻拍的货架、促销等零售场景图片,有效防范造假。针对模糊、摩尔纹、边框等优化,准确率达99%,支持Base64、文件、URL三种输入方式,返回翻拍/原图分类及置信度。
470 9