文字识别

首页 标签 文字识别
# 文字识别 #
关注
6225内容
独家揭秘:TikTok直播测试团队如何用AI把跨国时区兼容性测试从3周压到4小时
TikTok直播团队用AI攻克跨国时区测试难题:构建三层自动化体系,将150国、24时区兼容性测试从3周压缩至4小时,线上时区事故下降82%,实现“一台设备模拟全球用户”。
|
1月前
| |
来自: 视觉智能
阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。
|
1月前
|
AI生图无法编辑?Crop2Draw —— 把论文架构图「拆」进 draw.io
Crop2Draw 是一款开源工具,专为科研人员设计,可将论文/组会中难以编辑的位图架构图(如PDF截图、AI生成图)智能裁切、OCR识别文字,并一键导出为可编辑的 draw.io 文件,支持文字修改、颜色调整、模块重排,大幅提升复现与汇报效率。(239字)
AIGC 广告素材审核实践:从垂类模型到多模态合规治理
AIGC 广告素材审核的核心挑战,是在广告素材千万量级增长、秒级审核诉求和行业监管细化背景下,准确识别虚假误导、版权争议、行业准入、业务质量、品牌安全和多模态上下文风险。实践上,可采用垂类模型与大模型结合的架构,通过四级风险标签、CLIP 图文对齐、LLM 增强理解、知识蒸馏、策略引擎和人工复核形成治理闭环。
|
2月前
| |
多模态大模型与OCR有什么区别?从“识别文字”到“理解文档”的工程科普
本文厘清OCR与多模态大模型的本质差异:OCR专注“字符识别”,强调精准、可验证;多模态模型侧重“视觉理解”,擅长语义推理。二者能力分层,不可简单替代,而应协同——OCR提供坐标化文本证据,多模态模型处理复杂语义,再经规则校验与人工复核,构建稳定可靠的文档智能处理方案。
|
2月前
| |
阿里云Qwen3.7 Max与Plus全维度实测对比:多模态能力、架构、资费与选型指南
阿里云百炼平台推出的Qwen3.7系列包含Max、Plus两款商用核心模型,二者共享100万tokens超长上下文窗口、35小时自治执行上限两大核心基础能力,能够一次性承载百万字符文档、完整代码仓库、连续数十小时长流程智能体任务,但在底层架构、模态支持、输出上限、推理速度、计费标准上存在根本性区分,分别面向两类完全不同的AI业务赛道:极致纯文本重度推理场景、多模态图文视频综合业务场景。
|
2月前
| |
阿里云通义千问大模型最新功能介绍
阿里云通义千问是通义实验室打造的全栈式大模型家族,覆盖通用对话、长文本处理、多模态理解、代码生成、智能体执行等全场景能力,形成从入门到旗舰的完整产品矩阵。最新迭代的Qwen3系列,以**百万级上下文、原生多模态、全链路智能体**为核心标签,彻底突破传统大模型“对话工具”的局限,转向**自主思考、工具调用、任务执行**的智能体时代。
内容审核如何识别隐蔽引流?从样本构建到策略闭环
隐蔽引流识别要解决的是“正常表达背后的风险意图”。企业应把文本语义识别、联系方式检测、OCR、账号风险、行为序列和策略引擎组合起来,并在 POC 阶段准备正常样本、明确联系方式样本、暗语变体样本、评论协同样本、私信诱导样本和历史举报样本,综合评估召回率、误杀率、延迟、标签颗粒度和运营闭环能力。
|
2月前
|
图像内容审核-图片鉴黄-图片审核-图片内容审核-图片违规审核-图像审核API接口介绍
这是一款智能图像审核工具,支持自动识别色情、低俗、违禁行为(如吸烟、赌博)、恐怖恶心内容及图片内嵌违规文字,兼容多种图片格式与上传方式,提供精准分级审核结果。
|
2月前
| |
来自: 数据库
第三方API对接的通用封装模式
本文分享一套生产级Python第三方API封装实践:通过配置层、基类客户端、业务子类三层解耦,统一处理超时、重试、签名、异常分类(网络/鉴权/业务)与日志脱敏,让新渠道接入缩短至半小时,彻底告别裸奔式`requests.post`。
免费试用