文字识别

首页 标签 文字识别
# 文字识别 #
关注
6122内容
|
16天前
| |
来自: 云效DevOps
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
本文介绍`ui-testscript-enhancer`技能:自动为AI生成的UI测试脚本注入六大健壮性能力——智能等待、弹窗处理、iframe/Shadow DOM穿透、异常重试、失败截图录屏及验证码识别(集成ddddocr),5分钟将“能跑”的脚本升级为CI-ready的“跑得稳”生产级脚本。
|
16天前
|
阿里把内部用了两年的 AI 代码审查工具开源了——我跑了一遍 Open Code Review
阿里开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用“确定性模块 + LLM Agent”混合架构,精准定位问题、严控误报率,支持 Git 差异审查与全量扫描,已落地服务数万开发者。周增星 4750,Apache-2.0 协议,轻量易集成。(239 字)
|
17天前
|
【第二部分:大模型应用开发基础】6. Prompt Engineering 与 Context Engineering:生产级 Agent 如何管理上下文
本文从 Agent 开发实践出发,分析 Prompt Engineering 的作用与边界,说明复杂 Agent 为什么不能依赖超长 Prompt,并系统介绍 Context Engineering 对系统指令、用户目标、业务数据、工具结果、历史消息和任务状态的动态选择、组装、裁剪与压缩。文章结合合同审查 Agent 与 Java 示例,进一步讨论 Context Rot、Token 预算、Prompt Cache、可观测性及 Prompt Injection 防护,帮助开发者建立生产级 Agent 的上下文管理思路。
|
18天前
| |
阿里云Qwen3.7-Flash:轻量高速多模态大模型核心功能全解析
在大模型技术向轻量化、高性价比、全场景覆盖演进的当下,阿里云千问推出的Qwen3.7-Flash,作为原生视觉语言系列的轻量高速版本,凭借极致的推理速度、极低的使用成本与全面升级的多模态能力,成为高并发、低延迟场景的首选模型。该模型在Qwen3.6-Flash基础上实现全方位突破,重点强化多模态理解、万物识别、空间智能与Agent执行能力,同时优化多模态Coding与Vibe Coding体验,支持1M超大上下文窗口,适配从个人轻量应用到企业高并发服务的全场景需求。本文将从核心架构、基础能力、进阶功能、API调用、应用场景五大维度,全面解析Qwen3.7-Flash的功能特性,帮助开发者与企业
快手海外版测试不传之秘:AI一键翻译验证所有语种UI截断,把LQA周期从7天干到20分钟
本文介绍快手国际化团队如何用AI实现多语言UI自动化LQA测试:通过“自动化遍历+多模态视觉校验+智能报告”三层架构,将32种语言的LQA周期从7天压缩至20分钟,漏测率下降91%,大幅提升出海产品本地化质量保障效率。
独家揭秘:TikTok直播测试团队如何用AI把跨国时区兼容性测试从3周压到4小时
TikTok直播团队用AI攻克跨国时区测试难题:构建三层自动化体系,将150国、24时区兼容性测试从3周压缩至4小时,线上时区事故下降82%,实现全覆盖、高精准、零人工调时。
独家揭秘:TikTok直播测试团队如何用AI把跨国时区兼容性测试从3周压到4小时
TikTok直播团队用AI攻克跨国时区测试难题:构建三层自动化体系,将150国、24时区兼容性测试从3周压缩至4小时,线上时区事故下降82%,实现“一台设备模拟全球用户”。
|
18天前
| |
来自: 视觉智能
阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。
|
19天前
|
AI生图无法编辑?Crop2Draw —— 把论文架构图「拆」进 draw.io
Crop2Draw 是一款开源工具,专为科研人员设计,可将论文/组会中难以编辑的位图架构图(如PDF截图、AI生成图)智能裁切、OCR识别文字,并一键导出为可编辑的 draw.io 文件,支持文字修改、颜色调整、模块重排,大幅提升复现与汇报效率。(239字)
AIGC 广告素材审核实践:从垂类模型到多模态合规治理
AIGC 广告素材审核的核心挑战,是在广告素材千万量级增长、秒级审核诉求和行业监管细化背景下,准确识别虚假误导、版权争议、行业准入、业务质量、品牌安全和多模态上下文风险。实践上,可采用垂类模型与大模型结合的架构,通过四级风险标签、CLIP 图文对齐、LLM 增强理解、知识蒸馏、策略引擎和人工复核形成治理闭环。
免费试用