一道 370 年密码重走一遍要花多少 token?qwen3.8-max + 知识库 + pipeline 的三层链路实测:完整账单附后

简介: 九月中旬,AI破译370年古密码Cyphral Distich引发热议。本文实测百炼CLI三能力协同:qwen3.8-max拒编造、知识检索带溯源、pipeline流水线核验64位数字,全程免费、可复现、有边界。(239字)

九月中旬,一条「AI 破译 370 年密码」的新闻在技术社区传开:Vals AI 研究员用 Claude 的 Fable 5.1 在 44 分钟内破译了 1653 年的 Cyphral Distich,消耗 17.6 万 token。评测圈的讨论集中在模型能力上,但工程视角的问题更实际:这类多步核验任务,放在百炼的命令行工具链里,能不能走通?

我完整走了一遍。任务链三层:先排除「背答案」的可能(污染检查),再做一次结构发现实验,最后把逐位复核交给编排流水线并用自建密码做全链验证。全程只用了三类能力:bl text chat(qwen3.8-max 推理)、bl knowledge(检索)、bl pipeline(编排)。以下是实测记录。

场景:一条需要「检索 + 机械核对 + 边界判断」的任务链

密码题的公开材料分散在三处:题面与规则声明、32 段请愿短文转录、一份独立复核记录。核验目标:逐位检查 64 个数字位置在公开规则下是否成立。这类任务的特征很典型:材料要查、核对要逐项、结论要克制。

对应到平台能力,恰好是三类工具各接一段:材料要查交知识库检索,核对交 pipeline 编排,推理与判断交 qwen3.8-max 文本对话。先交代一个机制:Agent 不会因为普通提问就调用 bl,skill 里定义了路由规则,点名百炼或具体模型才走 CLI。

能力一:qwen3.8-max 的推理与「拒绝编造」

污染检查用三问递进:直接问术语、交代背景直问答案、编造词对照。结果三问全清:不认识术语(按构词法推测并索要出处,思考 3298 token);直问明文思考 5707 token 后回「不知道」,没有编造;对编造词,明确识别虚构可能并拒绝配合。

三问的递进有讲究:第一问测「知不知道」,第二问测「给足背景会不会编」,第三问是控制组——拿不存在的术语探「会不会顺着编故事」。第三问识破了虚构,前两问的「不知道」才算可信。

bl text chat --model qwen3.8-max --message "你听说过 Cyphral Distich 这个密码吗?"

对编造词的联想曾突破 600 秒超时(客户端 180 秒、网络层 UND_ERR_HEADERS_TIMEOUT 两道都触发过),加 --thinking-budget 2000 后 234 token 内完成拒答。思考预算参数是把「不可控长思考」变成「可控任务」的关键开关,后面实验反复用到。

顺带一个行为观察:思考量并不与任务难度成正比。认术语烧了 3298 token「试图回忆」,而编造词拒答只花 234:「不认识就不装懂」是低成本的默认行为。

能力二:知识库检索,让每个结论带出处

三份材料入库后,用 bl knowledge search 检索关键问题,top1 命中 0.826 相似度的段落,返回结果带引用来源,结论可逐条翻回原文核对:

bl knowledge search --query "哪些位置无法用词索引解释?" --agent-id <检索服务ID>

提醒一个坑:如果不用现成的检索服务、改用手搭,配置面要留足调试时间(我们补了 rerank_min_scoredense_similarity_top_k 两个参数才调通)。

能力三:pipeline 把机械核对变成 12 秒的流水线

64 个位置的逐位核对是纯机械活,写成三步流水线:载入数据(内嵌 64 数字 + 32 段正文)→ script/js 逐位核对 → qwen3.8-max 写简报。全链 12 秒(1 毫秒 / 2 毫秒 / 9.4 秒):

bl pipeline run --file crack_recheck.yaml --output json

耗时分布:核对 64 位的 script 步骤只花 2 毫秒,最后写简报的模型步骤占了 9.4 秒。机械核对与模型判断的成本量级差了几千倍,「机械活不交给模型」在这里就是白纸黑字的账。

复核数据:命中 5/64;换分词约定最高 8/64;随机基线 4-8;10 个位置结构不可行(数字越界或无对应首词)。模型简报守住边界:「在所列口径下未能复现该规则,不对原规则有效性作结论性判断。」

三个工程细节:script 输入要显式注入(args.<name> = {$from: ...});--events 只认 jsonl 字面量;pipeline 内模型步骤流式关闭,长思考必须给 thinking-budget(简报步 800 即可,9.4 秒完成)。

关键发现:两个可调参数

思考预算决定探索深度:不限预算的流式运行 49 分钟、思考链 340KB,才发现「64=32×2」结构(8 组映射假设仍全败,自评「结构置信度 70-80%、明文候选不到 5%」);2000 预算档想 2 分钟就被截断,结构都没看到。

49 分钟那轮留下的 340KB 思考链里有两个值得看的细节:数字 42 被它映射到单词「minus」并标注「非常可疑」,但没能继续推下去;它还把 32 段短文的词数全数了一遍(与脚本结果一致),摸到第 1 段第 5、25 个词是 H 和 E,写下「spells HE. Could be meaningful!」。另外,这轮跑完它主动声明「未查阅外部已知答案」。

搜索空间决定任务宽度:自建的中文同构密码(《三十六计》628 字书文、36 位密文),36 字直破失败(两次尝试:一次前 18 字对、后接错句,自核表标了「不符」结论却写「完全吻合」;一次 26/36 卡住),缩小到 10 字后一次通关,思考仅 697 token。

成本与额度

全程实付 0 元:所有任务都在 qwen3.8-max-0902 免费额度内跑完,结算时剩余 96.1%(961,249 / 1,000,000),12 月 1 日到期。按目录价折算(输入 12 / 输出 36 元每百万 token)约 1.03 元;含流式估算约 3.6-4.7 元。总消耗 11-14 万 token,与原事件公开的 17.6 万同量级。

免费额度口径(以官方文档为准):按模型独立计算、仅北京地域、90 天有效、过期不补、用尽不自动切换。

小结

三类能力的组合可以原样迁移到其他多步核验场景:bl text chat 负责推理与判断、bl knowledge 让结论有出处、bl pipeline 把机械核对流水线化。要点是分工清楚:机械的给脚本、判断的给模型、验证独立出来。

补一个边界说明:这套三层组合适合「一轮说不清、需要查材料、逐项核对再判断」的任务(数据对账、合同条款比对、长文档排错);如果是「单问题单答案」的简单任务,直接 qwen3.8-max 一次对话就够,套三层只会更慢更贵。

实测于 2026-09 中旬。环境:CLI 安装API Key 签发。成本数据以自己账号 bl usage free 为准。

相关文章
|
11天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
10天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
17天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
9天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1114 1
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
11天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1949 15
|
12天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
16天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1679 4
|
17天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1939 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
13天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
846 2
|
10天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
850 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)

热门文章

最新文章