还在用 Codex 开xhigh 拉满跑?夯错了小老弟

简介: Codex 的 `xhigh` 并非万能钥匙:它专为深度研究、安全审计等极难任务设计,耗时耗资高。日常开发用 `medium` 更稳,轻任务选 `low`,复杂逻辑才升 `high`。真正该拉满的,是人的判断力,而非模型推理档位。(239字)

我最近发现一个挺有意思的现象。

不少人用 Codex 的时候,上来就把 effort 开到 xhigh

不管是改个 README,还是修个小 bug,或者是启动一个项目,还是让它帮忙看一段报错,第一反应都是:拉满!!!

(不只针对 Codex ,所有具有 effort 的 LLM 都适用。)

这就像是你本打算洗个车,结果你车开进洗车房把车和人一块洗了。


这事儿吧,不能说完全没道理。

xhigh 肯定有用。OpenAI 既然给了这个档位,就说明它不是摆设。但是我越来越觉得,把它当默认配置,真不是最佳选项。

reasoning effort 不是智商开关,它更像一面镜子。

这面镜子能照出对不同任务难度的依赖程度,是主打多快好省还是啥都不考虑直接拉满。

你需要考虑的是更长的思考时间、更高的 token 消耗、更慢的响应,还有在复杂任务上更充分的推理空间。

但它不会自动帮你把一个烂任务变成好任务。

image-20260530174346491


我之前也有这个毛病。

刚开始用 coding agent 的时候,心态很朴素:反正我都让它干活了,那就给它开最强。

这就是订阅制的弊端,只要用不完,从心理上感觉就会亏。而且 Codex 上周一周重置三次的节奏,谁都会感觉亏。。。

image-20260526153155000

但用多了之后会发现,有些任务开 xhigh,不仅没必要,甚至有点反效果。

比如让 Codex 改一个变量名,补一段注释,整理一下日志,或者把一段 Markdown 改得更顺一点。

这种任务的核心诉求是什么?

多快好省。

你要的是它看懂、动手、改完、给 diff。不是让它在后台沉思半天,最后给你一个“经过综合权衡”的变量名。

更关键的是,xhigh 很容易让人形成一种错觉:只要结果不好,就是模型想得还不够久。

但很多时候,问题根本不在这。

问题可能是你没给测试命令,没说验收标准,也没告诉它哪个目录不能碰,也没把业务背景讲清楚,甚至只是工作区本来就一坨。

这些东西,开再高的 effort 也救不了。

它最多是在错误上下文里更认真地绕路。


官方其实也没让你一上来就拉满

OpenAI 的 Codex 配置文档里,确实有 model_reasoning_effort。它支持 minimallowmediumhighxhigh 这些档位。

image-20260526153350052

但是在 reasoning models 的说明里,xhigh 的定位写得很清楚:深度研究、异步工作流、需要很长 rollout 的 agent 任务,以及安全审计、复杂 code review、困难 coding 任务。

image-20260526153548884

还有一句我觉得非常关键:

只有当 eval 证明额外延迟和成本值得时,才用 xhigh

这就是很多人用 AI 工具时最容易忽略的地方:我们很容易把“更贵、更慢、更重”误认为“更专业”。

提示词越长,好像越专业。

上下文塞得越满,好像越专业。

MCP 接得越多,好像越专业。

effort 开得越高,好像越专业。

但工程不是这么玩的。工程讲的是约束、反馈和验证。一个任务如果 3 分钟能解决,你非让它用 30 分钟证明自己很努力,这不是专业,这叫看着很专业。


真正影响 Codex 的,往往不是 effort

Codex 跟普通聊天最大的区别,是它是 agent ,而普通聊天是 chat bot。

agent 会读文件、跑命令、看报错、改代码、再跑测试。

所以真正影响效果的,很多时候不是你把 effort 从 medium 拧到 xhigh,而是这些更朴实的东西:

项目根目录对不对。

测试命令有没有。

AGENTS.md 有没有把规矩讲清楚。

权限给够了没有。

上下文是不是干净。

你有没有告诉它“做到什么程度算完成”。

我现在越来越相信一件事:一个上下文清楚的 medium,经常比一个上下文混乱的 xhigh 靠谱。

而且更麻烦的是,默认 xhigh 会让你变懒。

你会少做任务拆分,少写验收标准,少关心测试反馈,最后把所有问题都丢给“你再好好想想”。

我之前经常这么干。

然后 xhigh 给你拉了一坨。

我们经常陷入到订阅陷阱里面去,就好像我们是为了消耗订阅而用,并不是为了把活干好而用。


我更推荐按任务分流

比较舒服的用法,其实很简单,先判断任务类型。

image-20260530174937782

轻任务就用 low

比如改文案、抽字段、整理格式、修一个很浅的类型错误。这类任务不需要深度推理,需要的是手快、别乱发挥。

常规开发用 medium

写一个小功能、补测试、处理普通 bug、看一段日志、做一次资料综合,medium 大部分时候够用。OpenAI 在 GPT-5.5 的说明里也提到,默认是 medium,而且很多 workloads 用 low 也能跑得不错。

复杂任务再上 high

比如跨模块重构、疑难 bug、架构方案取舍、长上下文分析。这个时候多给一点推理空间是合理的,因为任务本身就需要规划和权衡。

xhigh 呢?

留给少数真正硬的东西。

比如安全审计、复杂 code review、长链路研究、特别困难的 coding workflow,或者你已经试过 medium / high,确实发现它差一口气。

这时候再开 xhigh,我觉得没问题。

但默认就开,属于用李云龙的意大利炮打了个蚊子。

image-20260526164759871


如果你经常用 Codex CLI,可以配几个 profile。

[profiles.fast]
model_reasoning_effort = "low"

[profiles.work]
model_reasoning_effort = "medium"

[profiles.deep]
model_reasoning_effort = "high"

我这里故意没写 xhigh

原因是 xhigh 不应该成为日常的工作入口。

你真遇到那种“今天这个任务就是要让它狠狠干一把”的情况,再临时切过去就行。

这个跟权限也有点像。

你不会因为某个项目偶尔需要全盘访问,就把所有项目默认开成最大权限。工具给你选择,不代表每个选择都适合默认。


我一直觉得,AI 时代最容易被误解的一句话是:AI 放大人的能力。

很多人听到这句话,只听到了“放大”。

但它真正残酷的地方在于,它也会放大你的混乱。

你目标清楚,它帮你加速达成目标。

你判断模糊,它会带着你越跑越远。

你给它一个好问题,它能给你一个不错的解法。

你给它一个烂问题,再开 xhigh,它也只是更努力地陪你绕圈。

所以我现在用 Codex 的一个原则是:

日常 medium,轻任务 low,复杂任务 high

xhigh 留着。

真到需要的时候再开。

AI 是解题高手,但不是判断专家。真正该开到 extra high 的,是人的判断力。

相关文章
|
2月前
|
人工智能 运维 安全
Claude Code模型替换升级指南 接入DeepSeek V4-Pro实操与问题排查全解
当下终端AI编程工具Claude Code凭借轻量化、全流程代码处理、跨文件项目分析等优势,成为众多开发者日常编码、项目重构、漏洞修复、脚本编写的主流选择。原生状态下Claude Code绑定专属模型运行,虽然基础能力稳定,但在代码理解、长逻辑推理、中文场景适配、调用成本等方面仍存在优化空间。
1084 8
|
2月前
|
存储 人工智能 算法
告别无效刷屏!TrendRadar:最快30秒部署的开源热点助手,让你只看真正关心的新闻
TrendRadar 是一个轻量级、易部署的热点新闻聚合与推送工具。它能够从知乎、抖音、B站、微博、百度、华尔街见闻等11个主流平台抓取热搜榜单,然后根据你设定的关键词进行智能筛选,最终将你最关心的内容推送到手机或邮箱。
745 13
 告别无效刷屏!TrendRadar:最快30秒部署的开源热点助手,让你只看真正关心的新闻
|
2月前
|
人工智能 自然语言处理 数据可视化
阿里云万小智AI建站轻量版、标准版和高级版如何选择?有什么区别?
阿里云万小智AI建站提供轻量版(15元/月)、标准版(980元/年)和高级版(1980元/年)三档,支持对话式建站、可视化编辑与创意模式。功能逐级增强:含存储、CDN、多语言、支付插件等,资源配额与灵敏感值递增。新用户注册即赠.cn域名,在阿里云Club中心可领优惠券。万小智官网:https://t.aliyun.com/U/FmBHHe
513 123
|
2月前
|
机器学习/深度学习 人工智能 网络架构
深度解析:Transformer 的“灵魂”——QKV 变换的物理直觉
本文用图书馆检索等生活隐喻,从物理意义与认知科学角度解析Transformer中QKV设计的精妙本质:解耦查询(q)、键(k)、值(v)三重角色,实现语义分离、避免自注意力“自恋”,模拟人类动态信息路由的认知过程。(239字)
616 13
|
2月前
|
人工智能 运维 JavaScript
OpenClaw落地手册 阿里云部署流程、Token Plan设置及大模型Skill配置详解
在AI智能体技术快速普及的当下,OpenClaw凭借开源免费、私有化部署、任务自动化执行、多平台适配等优势,成为个人办公、开发运维、团队协作场景中热门的智能代理工具。很多新手在接触这款工具时,最先遇到的难题就是完整部署流程不清晰,同时不清楚如何搭配Token Plan套餐管控调用成本,也不了解大模型专属Skill技能模块的接入与配置方法,导致部署完成后无法发挥工具全部能力。
393 0
|
2月前
|
存储 人工智能 自然语言处理
拒绝“大模型幻觉”:一文彻底搞懂 RAG(检索增强生成)技术全流程
本文深入解析RAG(检索增强生成)技术,直击大模型落地私有知识场景的核心痛点——如何让LLM精准、低成本、高时效地基于企业文档作答。从文本分片、向量化索引,到召回重排、增强生成,系统拆解五大关键步骤,揭示RAG作为“AI外挂”的底层逻辑与工程实践精髓。
拒绝“大模型幻觉”:一文彻底搞懂 RAG(检索增强生成)技术全流程
|
2月前
|
存储 搜索推荐 大数据
优路教育借助阿里云Flink+StarRocks+Paimon湖仓一体化构建职业教育业务全链路实时数据服务平台
优路教育大数据团队携手阿里云,基于实时计算 Flink + EMR Serverless StarRocks + DLF(Paimon) 构建了全链路实时数据服务平台,从学员画像、营销筛选到题库关联查询,实现了从“分钟级延迟”到“秒级响应”的质变,为成人教育行业的数据化转型提供了标杆实践。
|
2月前
|
数据采集 人工智能 监控
医疗AI智能体:整体效能评估可视化:从原理到实践的10大核心量化指标体系.130
本文系统阐述医疗AI智能体的量化评估体系,强调其行业特殊性——关乎生命健康、强合规要求、用户多元、闭环严苛。提出覆盖技术(幻觉率、准确率、响应时间、召回率)与业务(满意度、审核通过率、问诊完成率、交互时长)的8大核心指标,配套数据采集、计算、监控、迭代闭环流程及可落地代码实现,为临床合规落地提供客观依据。
367 9
|
2月前
|
人工智能 机器人 Shell
专访 Bub 作者们:如何开发一个好记性又懂人的 Agent
这期播客主要聊了 Bub 是什么、它和普通聊天机器人/Agent 框架有什么不同,以及它背后的 Tape 记忆机制和插件化设计。简单来说,Bub 可以理解成一个以 channel 为中心的 AI Agent 框架。它不是只在命令行里写代码,也不只是一个群聊机器人,而是希望把不同 IM、命令行、工具、记忆和运行上下文连接起来,让用户可以根据自己的场景做一个定制版 Agent。
303 9

热门文章

最新文章