Qwen3.6-Fable-Fusion-711:209万下载是真的,「首个开源破700」得另说

简介: HuggingFace 和本地 LLM 圈被一个名字长得像密码的模型刷屏——Qwen3.6-27B-Fable-Fusion-711-…-GGUF,12 天下载量从 55 万飙到 209 万。它是社区开发者 DavidAU 在阿里 Qwen3.6-27B 上做「多阶段微调 + 模型融合 + 去审查」后以 GGUF 量化打包发布,能在本地显卡直接跑。最抓眼的「首个开源突破 700 ARC-C」目前只有作者一方说法:媒体都转自同一导流站、评测框架都没交代,唯一相对独立的行业媒体标了 unverified。当热门的去审查开源模型看成立,当「开源追上闭源」看还早。

氛围图

💡 一句话总结:下载量、热度、模型本身能跑——这些都真实成立。但「首个开源模型突破 700 ARC-C」这个最抓眼的卖点,目前只有作者一个人说了算:所有媒体报道都转自同一个导流站,连评测用什么框架都没交代,唯一相对独立的行业媒体直接标了「unverified」。把它当「一个热门的去审查开源模型」看,成立;当「开源已经追上闭源」看,还早。

导语:一个名字长得像密码的模型,凭什么刷屏

最近 HuggingFace 的 trending 和本地 LLM 圈,被一个名字长得像密码的模型刷屏了——Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF。光是把名字念完都要换口气。更夸张的是,12 天里它的主仓库从 55 万下载飙到 209 万,还衍生出 30 多个社区再量化镜像。

标题更唬人:「首个开源模型突破 700 ARC-C 门槛,此前只有 OpenAI、Claude、Gemini 能做到」。听起来像开源圈终于摸到了闭源前沿的脚后跟。对于一个天天被 API 价格和内容策略折腾的人来说,这话术戳得太准了——谁不想要一个免费、本地跑、还不受审查的「接近前沿」模型?

但你顺着这条新闻往回扒两层信源,画风就变了。这篇就来把这事说清楚:火是真的火,但火的理由和它宣传的理由,不完全是同一个。

想自己动手查?参考来源在这

先说清楚:这模型到底是啥

基座是阿里 2026 年 4 月发布的 Qwen3.6-27B(一个 270 亿参数的 dense 模型,也就是「所有参数每次都一起上阵」的常规架构,不是那种参数很大但每次只激活一部分的 MoE 混合专家)。然后一位 ID 叫 DavidAU 的社区开发者,在这个基座上做了一套「多阶段微调 + 模型融合 + 去审查」,打包成 GGUF 格式发布——GGUF 是 llama.cpp / Ollama 这类本地推理工具通用的量化打包格式,下载下来直接能在自己的显卡上跑。

那串吓人的名字,其实每个词都是一个卖点钩子叠在一起。按一位实测博主拆解的版本,翻译成人话大概是:

  • Fable-Fusion = 融合了「创意写作」方向的 Fable trace(trace 可以理解成「拿别的模型的优质输出当训练样本喂进去」)
  • 711 = ARC-C 跑了 0.711 分——这就是「突破 700」的由来(ARC-C 是一套高中难度科学推理选择题,专门测模型是「真懂还是靠蒙」,0.711 就是答对 71.1%)
  • Uncensored / Heretic = 去审查;Heretic 是 DavidAU 自创的去审查方法品牌,用的是 abliteration 思路(把模型内部那个「触发拒绝的方向」给抹掉,让它不再说「我不能回答这个」)
  • NM = Nightmedia,协助做模型融合的合作者
  • DAU = David AU,作者本人
  • NEO-MAX = DavidAU 自创的量化优化品牌(NEO IMATRIX,一种在量化时保护关键参数的技术,号称比标准量化准 2-4%)
  • MTP = Multi-Token Prediction,一次预测多个 token 而不是一个,有点像「提前看几步」来加速推理
  • GGUF = 上面说的本地量化打包格式

一句话总结:这就是一个「偏创意 + 去审查、用 NEO 量化重新烤过的 Qwen3.6-27B」。名字里每个词都是一个 SEO 钩子,全堆一起就成了一个能在 HuggingFace 搜索里通杀的怪兽。

这里先埋一个点,后面会用到:名字长,不等于模型强

209 万下载是真的,「破 700」是另一回事

下载量、30 多个衍生镜像、Reddit 和 YouTube 的讨论——这些热度都是实打实的,没有水分的痕迹。问题出在「首个开源突破 700 ARC-C」这个最响亮的卖点上。

你顺着这条声明往回扒信源,会发现一条挺整齐的单向链:

  • 所有「突破 700」的说法,源头都是 DavidAU 自己的模型卡
  • HackerNoon 写了两篇报道(7 月 21 日和 8 月 5 日),标题很唬人。但你翻到文末,赫然写着 Image source: AIModels.fyi,还有一句 join AIModels.fyi or follow us on Twitter
  • 也就是说,HackerNoon 的内容来自 aimodels.fyi 这个 AI 模型聚合 / 导流站;而 aimodels.fyi 的数据,又是直接抄 DavidAU 模型卡的
  • 三方对模型的概述段落几乎一字不差

换句话说:你看到的「媒体说它突破 700」,本质是「作者说自己突破 700 → 被一个导流站转写 → 被一家媒体转发」。整条链上没有一个人声称自己用标准评测框架独立跑过 ARC-C。唯一跳出这条链的独立行业媒体 EnterpriseDNA,用词是 claiming(声称),直接标了 unverified(未证实),而且它的关注点压根不在 benchmark,而在「去审查 + 消费级 + 半百万下载」这个产业信号上。

再补两刀,让这个「700」的分量更清楚:

  • 连 HackerNoon 自己的 limitations 节都写了:the testing harness used (not fully specified) may favor certain model characteristics——也就是作者没说清用什么评测框架、几 shot、哪个数据集划分。而 ARC-C 对这些设置极其敏感,换个 prompt 模板分数都能差一截。
  • 「首个突破 700」前面其实挂了一串限定词:of this size / across both precision levels(在这个参数量级、在两种量化精度下)。注意,更大的开源模型(70B 级别)在 ARC-C 上早就超过 0.70 了。这个「首个」是在一个被精心收窄的子类里成立的,但标题包装出来,给人的感觉是「开源终于追平闭源」。

所以这一层的关键不是「这个模型不行」,而是:下载量爆表和 benchmark 声明,是两件不同的事,别让前者替后者背书。模型是真的热门,热度是真的高,但「突破 700」目前还停在「作者自报、单一信源链放大」的阶段,等独立权威榜单(比如 LMSYS、Open LLM Leaderboard)背书之前,都得打个问号。

真正动手测的人,怎么说

如果说上面是「信源溯源」,那真正在能力层面给了独立判断的,是 note.com 上一个 ID 叫 CoolZero(zephel01)的博主。模型发布才两天(7 月 19 日),他就做了一套 60 道编码题 × 5 个量化配置的实测,方法学透明度比作者模型卡高出一截:llama.cpp + RTX 5090、用隐藏的 pytest 判分(模型看不到答案)、评测代码开源可复现。

他的几个结论:

  • 5 个配置里最佳的是 MTP Q5_K_M,做对 54/60,90.0%
  • MTP 版(88–90%)比标准版(85–87%)略好,速度还快约 1.7–1.9 倍——但这个差距只有 1-2 题,单次跑不足以定优劣,他很诚实地标注了「不因这点差异就说 MTP 更聪明」
  • 换着量化比,Q5 反而是峰值,更高位的 Q6 还掉了一档(量化精度和准确率不是简单的「越高越好」)
  • 关键:没打过同系列的代码特化兄弟版 Heretic-NEO-CODE,那个是 98.3%

最有价值的是他自己总结的那句话(意译):哪怕你在标签上堆满 NEO、MAX、Heretic,决定编码能力的,是融合数据的取向(偏创意还是偏代码),而不是量化名字或 imatrix 品牌。

这里要澄清一层:zephel01 测的是编码(他自建的 benchmark),不是 ARC-C。所以他的结论和「破 700」没有直接矛盾——他不证伪 ARC-C,也不佐证。他证明的是另一件事:在编码这个场景里,「创意向」的融合版打不过「代码向」的兄弟版。这恰好印证了前面埋的那个点——名字里写满什么,不等于模型真擅长什么。对一个想拿它干活的人来说,这个信号比那个 0.711 实在得多。

那它为什么还这么火

这就引出一个有意思的问题:既然 benchmark 存疑,为什么 12 天能冲到 209 万下载?

因为它真正击中的,不是「追 benchmark」的那拨人,而是想要一个「去审查 + 消费级可跑 + 号称接近前沿」三合一的群体。这三个条件凑齐的模型,市场上本来就不多。

拆开看那个最敏感的「去审查」:Heretic 方法把模型的安全拒绝率从 99/100 砍到 4/100(KL 散度 0.0469,意味着改动幅度很小、基本没伤模型整体能力)。落到体验上,就是它可以生成成人内容、恐怖、暗黑讽刺这类基座 Qwen 会直接拒答的东西。残留的 4/100 说明它还不完全一致——有时拒、有时不拒,边界有点飘。

EnterpriseDNA 给的定位大概是这场讨论里最实在的一句:这是给 cost-sensitive internal tasks where content policy doesn't matter——成本敏感、内容策略不构成约束的内部任务——用的。翻译成人话:你想在本地跑一个不被 API 内容策略绊住的模型干点啥,它合适。这跟「开源追上闭源」是两回事,但这个需求是真的、是大的。

不过有件事得顺着说清楚(不单拎个「注意事项」,就折在这儿):模型是 Apache 2.0 许可,允许商用,但 Apache 2.0 不提供责任保护——部署方要自己扛输出内容的锅。那 4/100 飘忽的拒绝率,对个人爱好者无所谓,对想拿它做企业部署的,就是实打实的合规风险。它不是能不能用的问题,是你用在哪、自己兜不兜得住的问题。

把话说明白

回到开头那个钩子:它到底摸没摸到闭源前沿的脚后跟?

把话说明白——这个模型的下载量、社区热度、可玩性都是真的,DavidAU 显然是一个既懂技术又懂社区传播的高产发布者(他围绕 Qwen3.6-27B 做了一整个「魔改宇宙」)。但「首个开源破 700 ARC-C」这个最响的卖点,目前还停在「作者自报、单一信源链放大」的阶段,没有任何独立权威评测给它背过书。媒体看着多,本质是同一条链的回声。

对不同的人,它意味着不同的东西:

  • 本地 LLM 爱好者:值得拉下来玩。去审查、消费级量化、256k 上下文、MTP 加速,这些都是实打实的体验,不依赖那个存疑的 0.711
  • 想拿它做正经部署的团队:去审查那 4/100 的飘忽、加上不提供责任保护的 Apache 2.0,得先想清楚能不能兜住
  • 追「开源追上闭源」这条叙事的人:等一个独立复现再说。别被 209 万下载和「突破 700」的标题带跑了——前者是热度信号,后者是待验证的声明,两者不是一个东西

一句话收住:这模型是真的火,但它火的原因,和它宣传自己火的理由,不完全是同一个。 把这两层分开看,你就不会被任何一个标题带偏。


参考来源


作者:lusca
版本:lusca-report-blog v1.4.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog

相关文章
|
20天前
|
人工智能 缓存 API
阿里云Qwen3.8-Max首发上线:API服务与Token Plan同步开放全解析
阿里云正式发布新一代旗舰基座大模型Qwen3.8-Max,同步上线千问AI平台API服务与百炼Token Plan订阅方案,面向全球开发者全面开放调用。作为通义千问系列首款突破2.4万亿参数的MoE混合专家模型,Qwen3.8-Max在编程能力、复杂逻辑推理、长文档处理与多模态智能体协作等领域实现跨越式升级,可独立自主完成16天连续编程任务,全程稳定可靠。本次上线的API服务提供兼容OpenAI与Anthropic的双协议接口,大幅降低迁移成本;Token Plan则以统一Credits计量,打通多模态能力与主流AI工具,为个人与团队提供高性价比的订阅选择。本文将全面解析Qwen3.8-Max
400 2
|
20天前
|
人工智能 编解码 搜索推荐
阿里云Wan3.0模型解析:模型能力、适用场景、模型价格、接入使用方式等
Wan3.0在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,让“万物皆可生视频”。与此同时,Wan3.0力求准确还原真实世界——人物千人千面,细节经得起审视,每一帧画面既真实、又可信。
|
22天前
|
机器学习/深度学习 编解码 自然语言处理
SwanTale:字节把声音克隆和「自然语言导演」塞进了同一个模型
字节2026年8月发布语音大模型SwanTale技术报告:首创SwanVAE+Flow-matching Transformer+Unified MoE+GRPO框架,统一实现自然语言驱动(instruct TTS)与零样本音色克隆(zero-shot TTS),支持多说话人、环境音、音效共生于单条波形。闭源报告,重方法论启发。(239字)
|
25天前
|
人工智能 缓存 API
阿里云百炼Night Plan全解析:夜间22:00-08:00错峰AI算力2折起深度指南
阿里云百炼Night Plan是百炼平台推出的**夜间错峰专属优惠计划**,核心价值是在夜间低峰时段为用户提供旗舰模型的超低折扣调用,帮助开发者、创作者与企业大幅降低AI算力成本。该计划覆盖Qwen3.7-Max、Qwen3.7-Plus等核心模型,在每晚22:00至次日08:00(北京时间)自动生效,无需手动切换配置,即可享受最高2折的专属价格,且服务质量、响应速度与白天完全一致。Night Plan深度适配Qoder CN、秒悟Meoo等百炼生态产品,与Token Plan、Coding Plan等订阅方案无缝兼容,是平衡AI算力成本与性能的最优选择。本文将从核心定位、适用范围、计费规则、
196 4
|
1月前
|
存储 算法 数据安全/隐私保护
为什么RAR有RAR3、RAR5,唯独没有RAR4?一文彻底搞懂RAR加密原理与密码恢复
本文揭秘RAR格式命名之谜:所谓“消失”的RAR4实为RAR3(Format 2.9)的历史别称;梳理RAR2→RAR3→RAR5演进脉络,详解AES-128到AES-256、SHA-1到PBKDF2的加密升级,并解析密码恢复工具为何只标“RAR3/RAR5”——关键在加密结构,不在版本号。(239字)
345 6
|
23天前
|
机器学习/深度学习 人工智能 API
Qwen3.8-Max 开源了:该不该从 Claude 切过去?
阿里正式发布2.4万亿参数旗舰Qwen3.8-Max,支持100万上下文与原生多模态,激活95B参数,推理成本仅6美元/百万token。下周将开源Max系列权重——史上首次,兼具强编码、长程智能体与办公自动化能力,但标准编程基准仍略逊Fable 5。(239字)
|
30天前
|
机器学习/深度学习 缓存 人工智能
一文读懂百炼 Kimi K3:2.8 万亿 MoE 模型、百万上下文、分层计费方案
全球首个开源3万亿级大模型Kimi K3正式上线阿里云百炼平台。该模型由月之暗面研发,参数达2.8万亿,支持100万Token超长上下文与原生视觉理解,具备文本生成、多模态推理及复杂逻辑深度思考能力,输入定价20元/百万Token(缓存命中仅2元)。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
25天前
|
移动开发 文字识别 自然语言处理
阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。
|
1月前
|
缓存 监控 测试技术
【剪映小助手】链接提取接口(Get Url)
链接提取接口是草稿自动化关键组件,用于解析并提取视频/素材URL。依托FastAPI与Pydantic构建,具备异步高并发处理能力,依赖清晰分层(路由→服务→模型→工具)。支持快速验证、缓存优化与结构化错误排查,OpenAPI为准。(239字)
|
1月前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
1733 12