1638289050099079_个人页

1638289050099079
个人头像照片
31
0
0

个人介绍

暂无个人介绍

擅长的技术

  • Python
  • Linux
获得更多能力
通用技术能力:

暂时未有相关通用技术能力~

云产品技术能力:

阿里云技能认证

详细说明
暂无更多信息

2026年08月

  • 08.28 16:35:54
    发表了文章 2026-08-28 16:35:54

    把表格压成 64 个 token,长文档问答反而更准了:先找表,再看数

    爱丁堡大学提出“两段式表格问答”:先用64视觉token压缩图精准定位相关表格(抗压缩),再以原生分辨率细读作答。长文档中总token降41%,准确率反升7个百分点,无需训练、即插即用。(239字)
  • 08.27 16:07:58
    发表了文章 2026-08-27 16:07:58

    从 3.94 亿页书里捞出 2262 万个视觉元素

    本研究提出轻量级视觉元素提取管线,面向哈佛图书馆数亿页古籍扫描,实现插图、乐谱、图表等五类非文本元素的检测、分类、去重与可选描述,最终释放2262万高质量视觉crop,兼顾精度、效率与可审计性。(239字)
  • 08.25 17:10:05
    发表了文章 2026-08-25 17:10:05

    把 8300 万个报纸版面单元变成可查询对象

    该管线首创“crop-first”范式,将历史报纸页图切分为结构化单元,每个crop附带OCR文本、类型、语言、实体、主题、阅读顺序及向量,支持精准过滤、重建与审计,大幅提升数字人文研究可用性。(239字)
  • 08.24 15:58:39
    发表了文章 2026-08-24 15:58:39

    ArmorOCR:模型读出了隐藏文字,但它知道自己在读哪里吗?

    ArmorOCR提出“接地式对抗视觉感知”,首创AdvSpot基准,要求模型同步定位文本区域并准确识别内容。通过两阶段训练(特权观察自蒸馏+组内强化学习),将8B模型AdvSpot准确率从31.2%提升至55.7%,推动对抗OCR从“能否读出”迈向“能否证真”。
  • 08.23 23:45:51
    发表了文章 2026-08-23 23:45:51

    35 种开源文档抽取配置,只有 4 个跨过 F1 0.5

    在真实公共部门成绩单上,开源零样本结构化抽取远未到可自动化水平;决定成败的不只是模型大小,OCR 是否保留行分组和表格结构同样关键。
  • 08.22 22:21:48
    发表了文章 2026-08-22 22:21:48

    DocClaw:让文档 Agent 记住自己刚刚读过哪里

    DocClaw提出统一文档智能框架,将任务差异置于技能层、可复用知识存于状态层、感知动作交给工具层,实现OCR、DocQA与KIE共享交互过程,显著提升多轮查询质量与效率。(239字)
  • 08.21 18:05:51
    发表了文章 2026-08-21 18:05:51

    OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉

    OmniHandwritingOCR 是首个面向手写OCR的细粒度诊断基准,含7.7万图像-标签对、6项子任务与12个子集,聚焦多行公式等难点;首创“事实性标注”,拒绝语义纠错,直击模型幻觉问题。(239字)
  • 08.20 17:12:48
    发表了文章 2026-08-20 17:12:48

    DocMemo:让长文档 RAG 学会带记忆地翻页

    DocMemo提出“读-记-更新-再找”循环机制,通过三层记忆(文档结构、页面信念、问题轨迹)显式建模检索状态,用Beta分布与Thompson采样动态更新页面相关性,在长文档RAG中显著提升证据召回率与准确率。
  • 08.19 14:00:09
    发表了文章 2026-08-19 14:00:09

    83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉

    FormStruct-Bench 是首个面向表单文档的层级化诊断基准,突破传统“字段对错”评测,精准定位区域、网格、字段路径、控件及关系等结构错误层。实测显示:模型内容识别(83.85%)远优于结构恢复(主结构仅17.91%),直击RAG、自动化入库等场景的核心痛点。
  • 08.18 15:48:42
    发表了文章 2026-08-18 15:48:42

    DEC:别急着重训,先让表格解析器再检查一遍

    这篇论文直击文档解析痛点:高分OCR在真实复杂表格中仍频出错。作者构建TableParseMap诊断基准,提出DEC框架——不重训模型,而是通过分解、增强、修正三步外挂式修复,为冻结/闭源解析器提供工程化补丁方案。(239字)
  • 08.17 11:29:39
    发表了文章 2026-08-17 11:29:39

    喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了

    该文揭示文档多模态大模型在图像模糊/缺失时,会凭记忆成组泄露姓名、证件号等关联敏感信息(最高泄露率95.5%),首创动态关系遗忘框架DRUF,实现泄露风险趋零且不损正常抽取能力,为KYC等高敏场景提供可落地的隐私防护新范式。(239字)
  • 08.16 16:05:11
    发表了文章 2026-08-16 16:05:11

    1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了

    NaviDC-OCR是中国电信AI团队推出的轻量级(1.2B)文档解析模型,专注解决手机拍摄文档的畸变、弯曲、透视等真实场景难题。它首创形变感知训练与边界点序列检测,结合内容-结构解耦学习,在OmniDocBench等四大基准全面登顶,小模型大幅超越Qwen3-VL、GPT-5.2等百B级通用大模型,为RAG与文档智能提供高鲁棒性“地基”。
  • 08.14 18:04:45
    发表了文章 2026-08-14 18:04:45

    AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报

    AutoDesign提出“元挽具优化”,将Agent的prompt、工具、流程等系统组件作为自动进化对象:外层循环优化系统,内层循环生成作品,模型权重不变。在论文转海报任务中,超越Claude Design 7.45分,验证了“弱模型+强系统”的高性价比路径。(239字)
  • 08.14 17:43:36
    发表了文章 2026-08-14 17:43:36

    视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方

    DreamX-Phi 1.0 创新性地将机械臂3D运动轨迹(SE(3))直接嵌入注意力机制(PRoPE),解决视频世界模型“画面真、动作错”的核心痛点,在WorldArena 2.0视频预测赛道夺冠,兼具几何精度与推理轻量性。
  • 08.13 10:28:32
    发表了文章 2026-08-13 10:28:32

    Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分

    Grok 4.6是xAI于2026年8月发布的1.5万亿参数大模型,专注长程智能体任务,AI指数61分追平GPT-5.6 Sol;回合效率领先(仅需53步),定价$2/$6(百万Token),但超20万Token即翻倍。
  • 08.13 09:35:49
    发表了文章 2026-08-13 09:35:49

    DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

    DeepSeek V4-Pro正式版(0813)上线,Agent能力跃升:DeepSWE达62.7(+5×),Terminal Bench 87.9,逼近Claude Fable 5;输入3元/百万Token、输出6元,成本仅其约1/46,但所有跑分尚未经第三方验证。
  • 08.12 11:33:35
    发表了文章 2026-08-12 11:33:35

    延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准

    抖音搜索团队提出DME方法,创新性采用“隐式潜推理+跨条件重建”双阶段训练机制,在不增加推理延迟前提下显著提升多模态嵌入的细粒度判别力;首创acc@K指标量化嵌入信息完备性,实现在MMEB-v2等评测中SOTA表现。(239字)
  • 08.10 16:23:09
    发表了文章 2026-08-10 16:23:09

    Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?

    Q-CueGraph 提出“看哪里”决策外化新范式,通过OCR版面图或开词汇检测构建证据图,精准裁剪仅19%画面,在V*Bench上将冻结Qwen2.5-VL准确率从0.696提升至0.833,揭示zoom价值依赖任务特性,重在可审计、可预算的理性决策框架。(239字)
  • 08.10 11:47:32
    发表了文章 2026-08-10 11:47:32

    Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

    这篇2026年新论文揭示:多模态大模型“能读出图中题目”不等于“会照它执行”。作者通过VTS控制实验确证“读≠用”的本质鸿沟,并提出region级prompt-region grounding训练法,在不依赖OCR、不增推理开销下显著缩小差距。(239字)
  • 08.09 23:58:45
    发表了文章 2026-08-09 23:58:45

    Agent 跑挂了,谁来背锅?TrajDebug 追着"错误的一生"找真凶

    TrajDebug是清华与腾讯提出的智能体关键错误定位新方法,首创“错误生命周期”追踪:先多粒度压缩长轨迹,再逐字证据检测局部错误,继而判断其是否被修复/留痕,最后在候选集中精准归因。在7个基准上最高达34.11%定位准确率,并可生成反馈提升Agent成功率。
  • 08.09 22:34:37
    发表了文章 2026-08-09 22:34:37

    20260809062836_flowpilot-uav-wam

    FlowPilot 是一种轻量级生成式世界-动作模型,首次将“未来场景预测”与“平滑轨迹生成”耦合于单模型中,在Jetson Orin NX上实现<18ms端到端推理,助力四旋翼在未知森林中以5.5m/s高速自主避障。
  • 08.08 15:51:10
    发表了文章 2026-08-08 15:51:10

    ConfBench:大模型的「我很有把握」,到底能不能信?

    ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算「省多少人工审核」的指标——做文档智能 / IDP 的人值得读。
  • 08.08 14:57:49
    发表了文章 2026-08-08 14:57:49

    PaDoc:让端到端文档解析不再串行——吞吐翻倍、延迟减半,质量还没掉

    PaDoc创新性提出“布局串行+内容并行”解码范式,通过祖先注意机制与vLLM前缀缓存,在保留整页上下文前提下实现区域级并发生成。同骨干模型下吞吐翻倍、P95延迟减半,质量不降反升(OmniDocBench 94.24),为端到端文档解析提供高效落地新路径。(239字)
  • 08.07 17:46:23
    发表了文章 2026-08-07 17:46:23

    Qwen3.6-Fable-Fusion-711:209万下载是真的,「首个开源破700」得另说

    HuggingFace 和本地 LLM 圈被一个名字长得像密码的模型刷屏——Qwen3.6-27B-Fable-Fusion-711-…-GGUF,12 天下载量从 55 万飙到 209 万。它是社区开发者 DavidAU 在阿里 Qwen3.6-27B 上做「多阶段微调 + 模型融合 + 去审查」后以 GGUF 量化打包发布,能在本地显卡直接跑。最抓眼的「首个开源突破 700 ARC-C」目前只有作者一方说法:媒体都转自同一导流站、评测框架都没交代,唯一相对独立的行业媒体标了 unverified。当热门的去审查开源模型看成立,当「开源追上闭源」看还早。
  • 08.05 18:01:00
    发表了文章 2026-08-05 18:01:00

    SwanTale:字节把声音克隆和「自然语言导演」塞进了同一个模型

    字节2026年8月发布语音大模型SwanTale技术报告:首创SwanVAE+Flow-matching Transformer+Unified MoE+GRPO框架,统一实现自然语言驱动(instruct TTS)与零样本音色克隆(zero-shot TTS),支持多说话人、环境音、音效共生于单条波形。闭源报告,重方法论启发。(239字)
  • 08.05 16:25:36
    发表了文章 2026-08-05 16:25:36

    为什么调一个文档抽取 pipeline 要花几周?IDP AutoOpt 让 agent 来替你

    AWS IDP AutoOpt 是一个闭环式LLM智能体,自动优化文档处理流水线(OCR、Prompt、模型、Schema等)配置,在2小时内达到甚至超越人类专家水平,精度提升8.6%,成本降为1/4.6。其三大反直觉工程经验:强模型不可妥协、结构化领域技能优于源码灌入、上下文管理需精细阈值控制。(239字)
  • 08.04 18:04:07
    发表了文章 2026-08-04 18:04:07

    Qwen3.8-Max 开源了:该不该从 Claude 切过去?

    阿里正式发布2.4万亿参数旗舰Qwen3.8-Max,支持100万上下文与原生多模态,激活95B参数,推理成本仅6美元/百万token。下周将开源Max系列权重——史上首次,兼具强编码、长程智能体与办公自动化能力,但标准编程基准仍略逊Fable 5。(239字)
  • 08.04 13:53:50
    发表了文章 2026-08-04 13:53:50

    做文档解析的人该看看 Infinity-Parser2:一个模型把版面、表格、公式、图表全端了

    Infinity-Parser2 是一款端到端多模态文档解析大模型,融合可控数据合成与多任务联合强化学习(GRPO),开源500万双语数据及Flash/Pro双版本模型,支持精准解析文本、表格、公式、图表等,显著提升RAG与文档智能效果。(239字)
  • 08.02 00:40:04
    发表了文章 2026-08-02 00:40:04

    阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

    本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。
  • 发表了文章 2026-08-28

    把表格压成 64 个 token,长文档问答反而更准了:先找表,再看数

  • 发表了文章 2026-08-27

    从 3.94 亿页书里捞出 2262 万个视觉元素

  • 发表了文章 2026-08-25

    把 8300 万个报纸版面单元变成可查询对象

  • 发表了文章 2026-08-24

    ArmorOCR:模型读出了隐藏文字,但它知道自己在读哪里吗?

  • 发表了文章 2026-08-23

    35 种开源文档抽取配置,只有 4 个跨过 F1 0.5

  • 发表了文章 2026-08-22

    DocClaw:让文档 Agent 记住自己刚刚读过哪里

  • 发表了文章 2026-08-21

    OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉

  • 发表了文章 2026-08-20

    DocMemo:让长文档 RAG 学会带记忆地翻页

  • 发表了文章 2026-08-19

    83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉

  • 发表了文章 2026-08-18

    DEC:别急着重训,先让表格解析器再检查一遍

  • 发表了文章 2026-08-17

    喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了

  • 发表了文章 2026-08-16

    1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了

  • 发表了文章 2026-08-14

    AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报

  • 发表了文章 2026-08-14

    视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方

  • 发表了文章 2026-08-13

    Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分

  • 发表了文章 2026-08-13

    DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

  • 发表了文章 2026-08-12

    延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准

  • 发表了文章 2026-08-10

    Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?

  • 发表了文章 2026-08-10

    Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

  • 发表了文章 2026-08-10

    Agent 跑挂了,谁来背锅?TrajDebug 追着"错误的一生"找真凶

正在加载, 请稍后...
滑动查看更多
正在加载, 请稍后...
暂无更多信息
正在加载, 请稍后...
暂无更多信息