让AI靠谱地写代码,你可能缺了一套Spec

简介: AI编程时代,模糊需求催生“能跑但不敢改”的代码。本文揭示:20个Agent并行产出20份自洽却南辕北辙的方案,根源在于缺乏明确Spec。Shopify、百度、阿里均通过统一环境、规格驱动(SDD)与工程化工具,将决策前移至定义阶段——定义越清晰,AI越可靠。

一句模糊的需求,20个Agent能给你并行产出20份完全不同的代码。每份都能跑,但每份都不是你想要的。

ScreenShot_2026-07-29_102135_377.png

你有没有遇到过这种情况:

你用AI编程工具,输入了一句需求。它很迅速,几秒钟就给你吐出了一套完整的实现。你跑了一下,成了。交付看上去近在咫尺。

但过两天你发现,生成的接口命名风格完全不是你团队的惯例。表结构缺少一个关键的索引。异常处理的逻辑覆盖了主流程但漏了一条分支。单元测试写是写了,但assert的断言条件全部浮于表面。

代码能跑,但改不动。改得动,但不敢保证改了不会连环崩。

这不是某个AI工具的问题。这是"需求模糊→Agent自由发挥"必然导向的结果。

模糊需求在AI时代会变得更危险

有执行经验的技术管理者总结过一个规律:执行能力越强,模糊需求越危险。

放在过去,需求模糊一些,开发人员会主动澄清、反复对齐,或者至少会把"我猜你是想要这个对吧"的确认环节前置。模糊性的代价是沟通成本,沟通过程中需求会被逐步校准。

但AI Agent不是这么工作的。

你给它一句含糊的需求,它会"尽职尽责"地给你一份完整答案。它不会追问"你这个接口的并发量大概是多少",也不会质疑"这里的缓存策略你确定不需要"。它会基于自己能理解的那部分,把其余的空隙用概率填上。

同一个模糊需求,开20个Agent的会话窗口,出来的就是20份逻辑上自洽但方向上可能南辕北辙的方案。从效率来看,生成速度拉满了。从结果来看,你获得了一堆需要逐个筛选的半成品。

前文中提到的拿百度内部实践的印证:"一句含糊的需求可驱动20个Agent并行产出20份完整错误答案"——不是Agent坏,而是Agent不会"拒绝不确定"。

大厂怎么解决这个问题

业内已经有一套被反复验证过的解法——把需求搞清楚再动手。

听起来像废话,但在AI编程的语境下,这件事的内涵变了。

Shopify做了什么

Shopify在两年前做了两个关键决策:一是把所有分散的代码合进一个Monorepo仓库,二是引入Nix把开发环境、CI环境和生产环境统一成一个可复现的数字底座。

这两个决策起初跟AI毫无关系。但River Agent上线后,团队立刻发现:当Agent能在一个统一的仓库里看到所有上下游代码,并且不会因为"在我机器上能跑"而漏掉环境问题——Agent的工作质量跳了一个台阶。

环境的统一,本质上是一种对Agent的硬约束——减少了模糊地带。

百度做了什么

百度在内部梳理了一套Spec-Driven Development(SDD,规格驱动开发)的流程,可以分解成六个部分:

  1. 目标:这个任务到底要达成什么
  2. 范围:边界在哪里,什么不用做
  3. 约束:技术栈限制、性能指标、安全要求
  4. 决策:为什么选A方案不选B的说明
  5. 任务:具体的执行步骤拆解
  6. 验收:怎样算"做完"

六部分缺一不可。团队规定,Agent拿到的Spec如果缺少边界条件、异常处理策略或验收标准,Agent有权拒绝开工。

不是人的权力下放给了Agent,而是Spec的质量变成了Agent产出质量的硬性前置条件。

百度把实践抽象成了三样东西:Rules固化工程范围,避免AI自由发挥跑出边界;Skills封装Code Review和E2E测试,让原本靠人工排队的检查动作变成自动化流水线;Spec约束技术方案,让AI每次生成都有据可依。

阿里的Qoder也这么搞

阿里旗下的Qoder工具推出了Quest Mode:先生成一份完整的Spec文档,作为人和Agent之间唯一的对齐事实源。Agent拿到Spec后在后台异步执行,执行过程中如果碰到歧义,不会自己猜,而是弹出"Action Required"等待人工决策。任务完成后交付的不是一段代码,而是一份Task Report,包含验证结果和完整的代码变更记录。

这三家的做法,本质上都在干同一件事:把决策复杂度从执行阶段前移到定义阶段。

工程化AI工具怎么实现SDD

SDD听起来是一套方法论,但它要落地,就需要工具有对应的产品架构来承接。

下载.png

飞算JavaAI在IDEA里的5步智能引导流程,可以看作SDD在Java工程里的一次工具化实现。

第1步——理解需求。你输入一句话的自然语言需求,它不会直接跳去生成代码,而是先把需求拆成一组子任务,让你确认。这一步对应SDD的"目标+范围"。

第2步——设计接口。它自动生成API接口的名称和逻辑描述,列出接口的输入输出、异常类型。这一步对应SDD的"决策+任务"。

第3步——表结构设计。它输出DDL建表语句,包括索引、约束、注释。你可以在这一步检查数据模型是否合理。对应SDD的"约束"。

第4步——处理逻辑。它给出一套业务逻辑的实现步骤,并且以流程图的形式可视化。对应SDD的"任务",而且因为可视化,验收路径极度清晰。

第5步——生成源码。前三步确认完毕,最后一步一键生成完整的Java工程包——源码、SQL脚本、配置文件,一个Maven项目直接导入IDEA就能跑。

这个流程的逻辑很简单:前面四步每步都是一个确认点,等于你在每一步都在跟AI对Spec。确认过了需求才设计接口,确认过了表结构才写逻辑,确认过了逻辑才生成代码。每一层的前置确认把模糊性逐层消解,到最后一步生成的时候,已经不是"让AI猜你想要什么",而是"AI按照你已经确认好的Spec来组装代码"。

这种方式和百度用Rules固化工程范围、用Spec约束技术方案是同一个思路的不同产品表达。区别在于,百度需要团队自己搭这套流程,而飞算是把这套流程内嵌到工具的产品架构里了。

结论:定义比生成更难,但也更重要

Shopify有句话复盘得特别到位:"代码库里为了让Agent读懂而需要偿还的债,其实就是你一直欠人类工程师的债。"

让AI靠谱地写代码,前提是你得先让AI清楚地知道你到底要什么。这不是AI的能力边界问题,是你定义问题的能力问题。跟有没有用到SDD这个词没有关系,跟你愿不愿意在'写代码'之前多花一倍的时间去'定义清楚'有关系。

做得好的团队,不是AI用得多猛,而是Spec写得多认真。

相关文章
|
8天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2188 12
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
8天前
|
云安全 人工智能 安全
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
986 1
|
10天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
988 44
|
8天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
997 0
|
6天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
480 1
|
9天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
689 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南