揭秘谷歌Gemini AI:主语与宾语顺序如何影响答案精准性?

简介: 谷歌新研究发现:前沿大模型虽能编码95%–98%的事实,却因主宾语顺序颠倒、长尾事实及回忆机制缺陷,导致26%–34%事实无法直接召回。瓶颈在于“回忆未饱和”,而非信息不足;多步推理可提升召回率,但计算成本高。

谷歌发布的一篇新研究论文发现,前沿的语言学习模型(LLM)能够编码95%至98%的测试事实,但在回答查询时却无法直接回忆起其中26%至34%的事实。部分原因是,当问题颠倒了训练过程中事实出现的主语/宾语实体顺序时,回忆就会变得更加困难。

参数信息

参数信息本质上是语言学习模型(LLM)在训练过程中编码的信息。这些信息来源于网页、歌词、书籍、说明书、代码以及LLM接受训练时所使用的所有其他资源。

研究人员试图解答的问题是:为什么语言学习模型(LLM)无法回忆起一些它们接受过训练的信息?此前人们认为,可能是因为语言学习模型接受的训练信息不足,但研究人员发现,对于前沿领域的语言学习模型而言,情况并非总是如此。

研究人员解释说,编码已经饱和,这意味着回答问题所需的信息通常已经在 LLM 中了。

他们写道:

“编码已饱和;回忆尚未饱和。对于 Gemini-3-Pro 和 GPT-5 等前沿语言学习模型而言,事实编码已接近饱和,95-98% 的事实已被编码。然而,这些模型无法直接回忆起 26-34% 的事实,即使经过思考,也无法回忆起 11-12% 的事实。”

因此,召回失败占 GPT-5.2 错误率的 70% 以上,在更强大的模型中占比更大,这表明召回确实是一个瓶颈。

这意味着瓶颈不在于前沿法学硕士缺乏足够的事实和信息,而在于如何获取这些信息。

主体和宾语实体

这项研究的一个有趣发现是,学习记忆模型(LLM)无法回忆起特定事实的原因之一是,与该事实相关的主体和客体是按特定顺序学习的。当向LLM提出一个顺序颠倒的查询时,由于学习顺序不同,LLM更难回忆起该事实。

该研究论文解释了主体和客体实体分别是什么:

“主体和客体的角色由提取事实的源文本(例如,维基百科文档)决定:主体是文本中首先出现的实体,客体随后出现。”

然后,它通过颠倒主语和宾语来解释其含义:

“答案是宾语的问题称为直接问句,答案是主语的问题称为反向问句。”

谷歌的解释器使用以下示例来说明主语/宾语实体对:

“Oasis乐队的首场演出是在Boardwalk俱乐部。”

在上面的例子中,“Oasis”是主语实体,“木板路俱乐部”是宾语实体。

因此,在“Oasis”和“The Boardwalk club”的例子中,当这些词对总是以“Oasis”在前出现时,LLM 会遇到无法回忆起查询中主语/宾语颠倒的事实的情况。

现在,我们又有了另一个有趣的发现。LLM能够识别出多项选择题中主语和宾语顺序颠倒的情况。

研究人员并未解释为什么LLM能够识别多项选择题中的答案。他们只是以此证明答案已被编码在LLM中,并且可以被识别。

问题的措辞对回忆的影响微乎其微。

研究人员测试了重新措辞问题是否会影响前沿逻辑学习模型回忆事实的能力。他们发现,重新措辞对模型回忆事实的能力没有显著影响。真正起作用的是颠倒主语/宾语的顺序。

长尾事实难以回忆

另一个有趣的发现是,前沿学习者在处理长尾事实(研究人员称之为罕见事实)时遇到了困难。编码常见事实和罕见事实之间的差距很小,但在回忆方面差距较大。无法回忆罕见事实通常并非因为学习者没有掌握这些信息,而是他们在回忆阶段遇到了瓶颈。

经过验证的解决方案:多加思考

研究人员测试了思维对回忆事实的作用,发现低层次思维模型(LLM)能够回忆起之前无法直接回忆起的40%至65%的已编码事实。然而,思维作用的缺点在于计算成本较高。研究人员还指出,何时触发思维作用也是一个需要考虑的问题。

扩大LLM培训规模并非解决方案

最后,研究人员指出,扩展前沿 LLM 并不能解决召回问题。

SEO与主语/宾语实体对

关于主语和宾语实体对顺序的直觉是,按照查询中最常见的顺序排列它们可能是有益的。这并非研究论文中的发现,也未经证实。但直觉上,按照最常见的顺序配对排列主语实体和宾语实体或许是合理的。

虽然该研究论文并未指出这些实体的常见排序将帮助LLM选择特定的网页,但从SEO的角度来看,这是一个合理的假设。

目录
相关文章
|
1天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1086 0
|
9天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3599 3
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
21天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13327 91
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
15天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1853 4
|
7天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。
|
10天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
16天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
2058 1