
💡 一句话总结:下载量、热度、模型本身能跑——这些都真实成立。但「首个开源模型突破 700 ARC-C」这个最抓眼的卖点,目前只有作者一个人说了算:所有媒体报道都转自同一个导流站,连评测用什么框架都没交代,唯一相对独立的行业媒体直接标了「unverified」。把它当「一个热门的去审查开源模型」看,成立;当「开源已经追上闭源」看,还早。
导语:一个名字长得像密码的模型,凭什么刷屏
最近 HuggingFace 的 trending 和本地 LLM 圈,被一个名字长得像密码的模型刷屏了——Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF。光是把名字念完都要换口气。更夸张的是,12 天里它的主仓库从 55 万下载飙到 209 万,还衍生出 30 多个社区再量化镜像。
标题更唬人:「首个开源模型突破 700 ARC-C 门槛,此前只有 OpenAI、Claude、Gemini 能做到」。听起来像开源圈终于摸到了闭源前沿的脚后跟。对于一个天天被 API 价格和内容策略折腾的人来说,这话术戳得太准了——谁不想要一个免费、本地跑、还不受审查的「接近前沿」模型?
但你顺着这条新闻往回扒两层信源,画风就变了。这篇就来把这事说清楚:火是真的火,但火的理由和它宣传的理由,不完全是同一个。
想自己动手查?参考来源在这
- 🌐 一手·HuggingFace 仓库:DavidAU/Qwen3.6-27B-Fable-Fusion-711-...-GGUF
- 📰 行业媒体(相对独立):EnterpriseDNA AI Pulse(2026-07-26)
- 🔬 独立实测:note.com / zephel01 的 60 任务评测
先说清楚:这模型到底是啥
基座是阿里 2026 年 4 月发布的 Qwen3.6-27B(一个 270 亿参数的 dense 模型,也就是「所有参数每次都一起上阵」的常规架构,不是那种参数很大但每次只激活一部分的 MoE 混合专家)。然后一位 ID 叫 DavidAU 的社区开发者,在这个基座上做了一套「多阶段微调 + 模型融合 + 去审查」,打包成 GGUF 格式发布——GGUF 是 llama.cpp / Ollama 这类本地推理工具通用的量化打包格式,下载下来直接能在自己的显卡上跑。
那串吓人的名字,其实每个词都是一个卖点钩子叠在一起。按一位实测博主拆解的版本,翻译成人话大概是:
- Fable-Fusion = 融合了「创意写作」方向的 Fable trace(trace 可以理解成「拿别的模型的优质输出当训练样本喂进去」)
- 711 = ARC-C 跑了 0.711 分——这就是「突破 700」的由来(ARC-C 是一套高中难度科学推理选择题,专门测模型是「真懂还是靠蒙」,0.711 就是答对 71.1%)
- Uncensored / Heretic = 去审查;Heretic 是 DavidAU 自创的去审查方法品牌,用的是 abliteration 思路(把模型内部那个「触发拒绝的方向」给抹掉,让它不再说「我不能回答这个」)
- NM = Nightmedia,协助做模型融合的合作者
- DAU = David AU,作者本人
- NEO-MAX = DavidAU 自创的量化优化品牌(NEO IMATRIX,一种在量化时保护关键参数的技术,号称比标准量化准 2-4%)
- MTP = Multi-Token Prediction,一次预测多个 token 而不是一个,有点像「提前看几步」来加速推理
- GGUF = 上面说的本地量化打包格式
一句话总结:这就是一个「偏创意 + 去审查、用 NEO 量化重新烤过的 Qwen3.6-27B」。名字里每个词都是一个 SEO 钩子,全堆一起就成了一个能在 HuggingFace 搜索里通杀的怪兽。
这里先埋一个点,后面会用到:名字长,不等于模型强。
209 万下载是真的,「破 700」是另一回事
下载量、30 多个衍生镜像、Reddit 和 YouTube 的讨论——这些热度都是实打实的,没有水分的痕迹。问题出在「首个开源突破 700 ARC-C」这个最响亮的卖点上。
你顺着这条声明往回扒信源,会发现一条挺整齐的单向链:
- 所有「突破 700」的说法,源头都是 DavidAU 自己的模型卡
- HackerNoon 写了两篇报道(7 月 21 日和 8 月 5 日),标题很唬人。但你翻到文末,赫然写着
Image source: AIModels.fyi,还有一句join AIModels.fyi or follow us on Twitter - 也就是说,HackerNoon 的内容来自 aimodels.fyi 这个 AI 模型聚合 / 导流站;而 aimodels.fyi 的数据,又是直接抄 DavidAU 模型卡的
- 三方对模型的概述段落几乎一字不差
换句话说:你看到的「媒体说它突破 700」,本质是「作者说自己突破 700 → 被一个导流站转写 → 被一家媒体转发」。整条链上没有一个人声称自己用标准评测框架独立跑过 ARC-C。唯一跳出这条链的独立行业媒体 EnterpriseDNA,用词是 claiming(声称),直接标了 unverified(未证实),而且它的关注点压根不在 benchmark,而在「去审查 + 消费级 + 半百万下载」这个产业信号上。
再补两刀,让这个「700」的分量更清楚:
- 连 HackerNoon 自己的 limitations 节都写了:
the testing harness used (not fully specified) may favor certain model characteristics——也就是作者没说清用什么评测框架、几 shot、哪个数据集划分。而 ARC-C 对这些设置极其敏感,换个 prompt 模板分数都能差一截。 - 「首个突破 700」前面其实挂了一串限定词:of this size / across both precision levels(在这个参数量级、在两种量化精度下)。注意,更大的开源模型(70B 级别)在 ARC-C 上早就超过 0.70 了。这个「首个」是在一个被精心收窄的子类里成立的,但标题包装出来,给人的感觉是「开源终于追平闭源」。
所以这一层的关键不是「这个模型不行」,而是:下载量爆表和 benchmark 声明,是两件不同的事,别让前者替后者背书。模型是真的热门,热度是真的高,但「突破 700」目前还停在「作者自报、单一信源链放大」的阶段,等独立权威榜单(比如 LMSYS、Open LLM Leaderboard)背书之前,都得打个问号。
真正动手测的人,怎么说
如果说上面是「信源溯源」,那真正在能力层面给了独立判断的,是 note.com 上一个 ID 叫 CoolZero(zephel01)的博主。模型发布才两天(7 月 19 日),他就做了一套 60 道编码题 × 5 个量化配置的实测,方法学透明度比作者模型卡高出一截:llama.cpp + RTX 5090、用隐藏的 pytest 判分(模型看不到答案)、评测代码开源可复现。
他的几个结论:
- 5 个配置里最佳的是 MTP Q5_K_M,做对 54/60,90.0%
- MTP 版(88–90%)比标准版(85–87%)略好,速度还快约 1.7–1.9 倍——但这个差距只有 1-2 题,单次跑不足以定优劣,他很诚实地标注了「不因这点差异就说 MTP 更聪明」
- 换着量化比,Q5 反而是峰值,更高位的 Q6 还掉了一档(量化精度和准确率不是简单的「越高越好」)
- 关键:没打过同系列的代码特化兄弟版 Heretic-NEO-CODE,那个是 98.3%
最有价值的是他自己总结的那句话(意译):哪怕你在标签上堆满 NEO、MAX、Heretic,决定编码能力的,是融合数据的取向(偏创意还是偏代码),而不是量化名字或 imatrix 品牌。
这里要澄清一层:zephel01 测的是编码(他自建的 benchmark),不是 ARC-C。所以他的结论和「破 700」没有直接矛盾——他不证伪 ARC-C,也不佐证。他证明的是另一件事:在编码这个场景里,「创意向」的融合版打不过「代码向」的兄弟版。这恰好印证了前面埋的那个点——名字里写满什么,不等于模型真擅长什么。对一个想拿它干活的人来说,这个信号比那个 0.711 实在得多。
那它为什么还这么火
这就引出一个有意思的问题:既然 benchmark 存疑,为什么 12 天能冲到 209 万下载?
因为它真正击中的,不是「追 benchmark」的那拨人,而是想要一个「去审查 + 消费级可跑 + 号称接近前沿」三合一的群体。这三个条件凑齐的模型,市场上本来就不多。
拆开看那个最敏感的「去审查」:Heretic 方法把模型的安全拒绝率从 99/100 砍到 4/100(KL 散度 0.0469,意味着改动幅度很小、基本没伤模型整体能力)。落到体验上,就是它可以生成成人内容、恐怖、暗黑讽刺这类基座 Qwen 会直接拒答的东西。残留的 4/100 说明它还不完全一致——有时拒、有时不拒,边界有点飘。
EnterpriseDNA 给的定位大概是这场讨论里最实在的一句:这是给 cost-sensitive internal tasks where content policy doesn't matter——成本敏感、内容策略不构成约束的内部任务——用的。翻译成人话:你想在本地跑一个不被 API 内容策略绊住的模型干点啥,它合适。这跟「开源追上闭源」是两回事,但这个需求是真的、是大的。
不过有件事得顺着说清楚(不单拎个「注意事项」,就折在这儿):模型是 Apache 2.0 许可,允许商用,但 Apache 2.0 不提供责任保护——部署方要自己扛输出内容的锅。那 4/100 飘忽的拒绝率,对个人爱好者无所谓,对想拿它做企业部署的,就是实打实的合规风险。它不是能不能用的问题,是你用在哪、自己兜不兜得住的问题。
把话说明白
回到开头那个钩子:它到底摸没摸到闭源前沿的脚后跟?
把话说明白——这个模型的下载量、社区热度、可玩性都是真的,DavidAU 显然是一个既懂技术又懂社区传播的高产发布者(他围绕 Qwen3.6-27B 做了一整个「魔改宇宙」)。但「首个开源破 700 ARC-C」这个最响的卖点,目前还停在「作者自报、单一信源链放大」的阶段,没有任何独立权威评测给它背过书。媒体看着多,本质是同一条链的回声。
对不同的人,它意味着不同的东西:
- 本地 LLM 爱好者:值得拉下来玩。去审查、消费级量化、256k 上下文、MTP 加速,这些都是实打实的体验,不依赖那个存疑的 0.711
- 想拿它做正经部署的团队:去审查那 4/100 的飘忽、加上不提供责任保护的 Apache 2.0,得先想清楚能不能兜住
- 追「开源追上闭源」这条叙事的人:等一个独立复现再说。别被 209 万下载和「突破 700」的标题带跑了——前者是热度信号,后者是待验证的声明,两者不是一个东西
一句话收住:这模型是真的火,但它火的原因,和它宣传自己火的理由,不完全是同一个。 把这两层分开看,你就不会被任何一个标题带偏。
参考来源
- DavidAU HF 仓库(一手·作者自报) — https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- HackerNoon「Breaks the 700 ARC-C Barrier」(媒体·导流性质,文末标注 image source: AIModels.fyi) — https://hackernoon.com/qwen36-27b-fable-fusion-breaks-the-700-arc-c-barrier
- EnterpriseDNA AI Pulse 2026-07-26(行业媒体·相对独立,标 unverified) — https://enterprisedna.co/resources/ai-pulse/ai-pulse-2026-07-26-an-uncensored-27b-open-weight-model-claiming-near-frontier-r/
- note.com / zephel01 60 任务实测(社区·独立实测,方法学透明) — https://note.com/zephel01/n/n6e401304c118
- aimodels.fyi 模型页(聚合站·信源中转层) — https://www.aimodels.fyi/models/huggingFace/qwen3.6-27b-fable-fusion-711-uncensored-heretic-nm-dau-neo-max-mtp-gguf-davidau
作者:lusca
版本:lusca-report-blog v1.4.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog