清洗一份 CSV,也能看出模型是否守住了规则
一张表里,订单编号有前导零,金额列混着空值,状态又同时出现中文和英文。如果只要求“帮我整理干净”,模型很容易交出一份外观整齐、细节却变了的数据。我会把这种小任务加入中转站选型,不只盯着代码生成效果。
先约定哪些内容绝对不能猜
我会用虚构数据做样例,明确订单编号必须保留原文,缺失金额不能自动填成零,无法识别的状态要进入待确认列表。下面这几行就足够设计一个边界检查:
order_id,amount,status
00123,19.90,paid
00124,,pending
00125,0,unknown
第二行的空金额和第三行的零不是同一种信息;未知状态也不能因为没有报错,就被归入成功。规则先写清楚,后面才知道错误来自需求缺失还是执行偏差。

让处理过程可以重跑
如果用 Codex 协助整理,我会要求它优先使用项目已有的数据处理工具,保留原文件,并生成独立结果。不是直接手改几行给我看,而是留下输入、规则和执行方式,让同一批数据还能再次得到可检查的输出。
gpt-6-astra 和 gpt-6.1-sol 可以分别用这份样例评估。比较时检查编号是否保持、缺失项是否保留、异常行是否单独列出,不根据回答语气判断谁更可靠,也不把这三行样例扩展成整体能力排名。
不降智,也意味着不擅自补齐未知信息
我更愿意收到“有一行需要人工确认”,而不是一份悄悄猜完所有空值的漂亮表格。对于数据任务,“不降智”不只是算得对,还包括忠实保留原始含义,遇到矛盾能指出来,做过的转换能解释清楚。

评估 aibridgea点com 这样的候选入口时,我会把小表格、代码任务和文档任务组合起来看。不同场景各有检查点,比只用一道擅长的题反复验证,更容易发现自己真正不能接受的问题。
本文样例为虚构数据,未提供真实清洗结果;配图沿用此前素材,可用模型、当前费用和实际表现需另行核验。