一个公开挑战:任意语言、完全离线,跑不通算我们的

简介: 讲「可信 Agent」的文章很多,交出可证伪实物的很少。我们把协议规范冻结、35 个测试向量公开,并在记分牌上留了两个空位——独立实现数,rttp: 0,iqa: 0,作者自己的实现不算数。规则只有四条:只看规范、任意语言、完全离线、确定性。跑通全部向量,你的名字进规范记录;跑不通,那是我们的 bug,署名致谢并重新发布向量。横竖都是你赢。

「A specification is worth exactly what a stranger can reproduce from it.」
—— 一份规范的价值,恰好等于一个陌生人能从它复现出什么。

这一年,讲「可信 Agent」「语义寻址」「可审计」的文章很多。我们也不想免俗——所以我们决定做一件俗气的事:把我们的协议规范冻结,把 35 个测试向量公开,然后在记分牌上留两个空位,等一个陌生人来跑。

规则只有四条,逐字来自 iqa.org/challenge/:

  1. 只看规范。不许读我们的源码。
  2. 任意语言。零限制。
  3. 完全离线。无账号、无网络、无回传。
  4. 确定性。同样输入,同样字节,每次都一样。

30 秒自检(装完就能跑)

pip install rttp && python -m rttp.selftest              # [PASS] all 80 checks passed (3 skipped)
pip install "rttp[ed25519]" && python -m rttp.selftest   # [PASS] all 83 checks passed
pip install iqa-org && python -m iqa.selftest            # [PASS] all 108 checks passed (3 skipped)
pip install "iqa-org[ed25519]" && python -m iqa.selftest # [PASS] all 111 checks passed
npm install @aicent/rttp && npx @aicent/rttp             # [PASS] all 35 checks passed
cargo add rttp && cargo test                             # [PASS] 13 tests + 1 doc test
npm install @aicent/iqa && npx @aicent/iqa               # [PASS] all 32 checks passed
cargo add iqa-org && cargo test                          # [PASS] 18 tests + 2 doc tests

这八行命令的预期输出写死在挑战页上——CI 每次推送都在断言。你装完跑一遍,就知道我们的实现和文档说的是不是同一件事。

需要说明:「任意语言」是给挑战者的自由,不是我们实现的边界——三个参考实现只是起点,不是上限。Go、Java、C……记分牌等的正是它们。

fig1-flow.png

记分牌:0 比 0,席位空着

挑战页上有一块记分牌:独立实现数,rttp = 0,iqa = 0。

页面上还有一句更狠的:「作者自己的参考实现不算数——这正是这个页面存在的全部意义。」

所以那两个席位是给谁的?给任何只读规范、不看我们源码、用任意语言重写出确定性结果的人。跑通全部 35 个向量,你的名字、你的仓库、你的版权会被列在挑战页上,进入规范的 Implementation Status 章节被长期引用。

如果跑不通呢?

页面的原话:「如果向量在规范的忠实解读下失败了,那是我们的 bug。我们修复规范或实现,署名致谢你,并用新摘要重新发布向量。」

这套流程最好玩的地方在于:横竖都是你赢。 跑通了,你的名字进记录;跑不通,我们的错误被你署名修复。甚至如果你只想安静通过、不想被列出,那也算通过。

诚实边界

规范正在 IETF 独立提交通道审核中(rttp:// 已获 IANA 注册 · Provisional · CRI 27;iqa:// 在CRI专家审查中)。我们挑战的是「文档是否自足」——不是市场地位,不是谁的口号响。这个页面从上线那天起就在那里,席位至今空着。

现在它也在中文世界里贴出来了。

  • 挑战页:iqa.org/challenge/
  • 提交:公开仓库链接 + 回放输出 → lee@iqa.org

跑通了,你的名字进记录;跑不通,我们的错误署名修复——横竖都是你赢。

目录
相关文章
|
2天前
|
消息中间件 人工智能 监控
云栖剧透丨AI 应用进入生产,开始拼「实时数据智能」
9 月 22 日下午,欢迎来到杭州国际博览中心一期四楼 404 厅,与我们一起讨论实时数据智能如何支撑 AI 应用真正进入生产。
|
1天前
|
网络协议
为什么 Agent 的地址不该"分配",该"派生"
Agent 跨域互调,第一件事是"找到它、认出它"。主流做法是分配地址——DNS、CA、DID 注册表,每次验证一次在线往返。本文讲 RTTP 的另一条路:地址由 SHA-256 派生而非机构分配,验证方本地重算即核对,离线可用。128 位裕量怎么算的、一个 shard 为什么能身兼三职,全部公开可查。已获 IANA 注册(CRI 27)。
70 3
为什么 Agent 的地址不该"分配",该"派生"
|
1天前
|
网络协议
一个协议装不下:语义寻址与信任证明为什么分成两个 scheme
Agent 跨域互调,要同时解决「找到谁、做什么」与「谁授权、凭什么」。本文盘点现有协议栈的缺口——DNS+CA 在线双问、OAuth 回 IdP、DID 解析回网、MCP 不管身份语义——论证语义寻址(锚在哈希)与信任证明(锚在密钥)因信任锚不同源,无法装进同一个 scheme;并给出落地形态:一份合并草案、两个 scheme,在字节层共享同一 16 字节分片完成闭环。
42 2
一个协议装不下:语义寻址与信任证明为什么分成两个 scheme
|
1天前
|
人工智能 JSON 安全
设计系统负责人的语义生长|约束显化:把1条"绝对不能"翻译成机器规则
设计系统负责人从"管视觉"延伸到"管语义"的三个最小可行动作:追问1个Design Token的语义场景、核对1个组件的语义域身份、将1条口头禁令翻译为机器可执行规则。附验收标准与四阶段生长路径,证明语义评审可从现有规范自然生长,无需等待全套基础设施建成。
|
1天前
|
安全 测试技术
推广预算越花越多询盘没起色:B2B电商付费流量的承接难题
本文剖析1688数字营销效果分化的根本原因:推广仅解决流量获取,转化依赖店铺承接能力。指出主推款结构、详情页信息密度、响应速度、成本核算与流量结构五大前置条件呈乘法关系,任一短板即导致投放失效,并提出小预算测试、承接先行等实操建议。(239字)
|
2天前
|
人工智能 运维 监控
智能聚类:从海量 Trace 中理解 Agent 的行为和表现
本文介绍从海量 Agent Trace 和 Session 中提取请求意图与用户任务并行进行聚类,结合耗时、Token 消耗与交互摩擦分析运行表现,帮助发现线上共性问题,为问题排查与能力优化提供依据。
|
1天前
|
人工智能 安全 小程序
阿里云服务器199元1年购买与使用常见问题:2核4G5M带宽,续费同价,企业用户专享
阿里云199元/年通用算力型u1实例(ecs.u1-c1m2.large)面向企业实名认证用户,配置2核4G、5Mbps固定公网带宽、80GB ESSD Entry云盘,主打"续费同价",活动延至2029年3月31日,最长可同价使用5年,适合建站、开发测试、后台管理、小程序及跨境出海等通用场景;个人账号无法购买,同一企业主体最多保有一台,适合预算敏感的中小企业长期选用。
|
18天前
|
云安全 人工智能 安全
|
1月前
|
算法 自动驾驶 安全
AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
Agent 上线的那一刻,真正的考试才开始:上线只是起点,持续调优才是关键。本文用一小时实操带你看 AgentLoop 如何把接入、评估、实验、经验库串成数据飞轮,以专家驱动与全自动经验挖掘,让 Agent 越转越聪明。
420 18
|
1月前
|
消息中间件 人工智能 Apache
Apache RocketMQ 面向 AI 演进:LiteTopic 支撑百万级多 Agent 会话协作
本文整理自 Apache 2026 技术分享《面向 AI 的 Apache RocketMQ:多 Agent 系统的可靠协作机制》。
214 18