通用文字位置识别-文字OCR位置-文字识别接口介绍

简介: 本API基于深度学习,识别精度高达99.9%,支持图片、PDF、OFD多格式输入,返回文字内容、坐标位置、轮廓点、段落结构及置信度,助力政务、财务、证件、文档等场景高效结构化处理。

前言

传统人工录入图文资料存在效率低、出错率高、无法留存文字位置版式信息等问题。本通用文字识别 API 依托深度学习优化算法,识别精度最高可达 99.9%,支持图片、PDF、OFD 文件解析,同步返回文本坐标、轮廓点位、段落结构与置信度数据;可快速对接各类业务系统,完成图像文字结构化、版式还原等智能化处理。

通用文字识别在以下场景中应用广泛:

  1. 政务档案数字化
  2. 财务单据自动处理
  3. 资质证件信息采集
  4. 固化电子文档解析
  5. 日常图文文字提取
  6. 工业资产信息采集
  7. 版面还原与标注开发
  8. 企业办公自动化

API介绍

请求说明

名称 类型 必须 说明
image String 图片base64
pdf String PDF文件的base64
pdfNum String 需要识别的PDF文件的对应页码,不传默认识别第 1 页
ofd String OFD文件的base64
ofdNum String 需要识别的OFD文件的对应页码,不传默认识别第 1 页
file File 文件
url String 文件地址
  • image、pdf、ofd、file、url 必须提供一个,优先级:image > pdf > ofd > file > url
  • 文件不超过4M,最短边至少15px,最长边最大4096px
  • 图片格式为 jpg、png、bmp、jpeg

戳这里查看详情

返回样例

{
   
  "msg": "成功",// code 对应的描述
  "code": 200,// 详见code返回码说明
  "taskNo": "316942821199035820008485",// 本次请求号
  "data": {
   
    "resultNum": 2,//识别结果数
    "result": [//识别结果
      {
   
        "words": "测试第一行",//识别结果字符串
        "location": {
   //位置数组(坐标0点为左上角)
          "top": 72,//表示定位位置的长方形左上顶点的垂直坐标
          "left": 89,//表示定位位置的长方形左上顶点的水平坐标
          "width": 52,//表示定位位置的长方形的宽度
          "height": 12//表示定位位置的长方形的高度
        },
        "probability": {
   //表示识别结果中每一行的置信度值
          "average": 0.9956096411,//行置信度平均值
          "min": 0.9842295051,//行置信度最小值
          "variance": 0.00003516419747//行置信度方差
        },
        "vertexesLocation": [//识别结果中每一行的外包四边形点坐标
          {
   
            "x": 90,//水平坐标(坐标0点为左上角)
            "y": 73//垂直坐标(坐标0点为左上角)
          },
          {
   
            "x": 142,
            "y": 73
          },
          {
   
            "x": 142,
            "y": 85
          },
          {
   
            "x": 90,
            "y": 85
          }
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
   
            "x": 89,
            "y": 72
          },
          {
   
            "x": 101,
            "y": 72
          },
          {
   
            "x": 113,
            "y": 72
          },
          {
   
            "x": 124,
            "y": 72
          },
          {
   
            "x": 136,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 78
          },
          {
   
            "x": 141,
            "y": 84
          },
          {
   
            "x": 130,
            "y": 84
          },
          {
   
            "x": 118,
            "y": 84
          },
          {
   
            "x": 106,
            "y": 84
          },
          {
   
            "x": 95,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 78
          }
        ]

      },
    ],
    "paragraphsResult": [//段落检测结果
      {
   
        "wordsResultIdx": [//一个段落包含的行序号
          0,
          1
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
   
            "x": 89,
            "y": 72
          },
          {
   
            "x": 101,
            "y": 72
          },
          {
   
            "x": 113,
            "y": 72
          },
          {
   
            "x": 124,
            "y": 72
          },
          {
   
            "x": 136,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 72
          },
          {
   
            "x": 141,
            "y": 84
          },
          {
   
            "x": 141,
            "y": 88
          },
          {
   
            "x": 141,
            "y": 100
          },
          {
   
            "x": 141,
            "y": 100
          },
          {
   
            "x": 129,
            "y": 100
          },
          {
   
            "x": 117,
            "y": 100
          },
          {
   
            "x": 104,
            "y": 99
          },
          {
   
            "x": 92,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 99
          },
          {
   
            "x": 89,
            "y": 87
          },
          {
   
            "x": 89,
            "y": 84
          },
          {
   
            "x": 89,
            "y": 72
          }
        ]

      }
    ],
    "paragraphsResultNum": 1,//识别结果数,表示 paragraphsResult 的元素个数
    "pdfFileSize": 1//传入PDF文件的总页数,当 pdfFile 参数有效时返回该字段
  }
}
相关文章
|
6天前
|
人工智能 JSON 安全
|
6天前
|
云安全 人工智能 安全
|
6天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
828 1
|
6天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
859 0
|
8天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
823 36
|
4天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
391 1
|
7天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
635 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南