上海创智学院联合无问芯穹发布Megrez2.0,本征架构突破端模型不可能三角,以终端算力撬动云端智能

简介: 终端是实现数字智能和生命智能自由交互的重要接口,持续帮助人类拓展生产能力的边界。当下,终端智能面临着“能效-空间-智能”的不可能三角:以DeepSeek-R1为例,其参数规模高达6710亿,超出了大部分笔记本电脑的内存容量;即使勉强在一台笔记本电脑上成功运行满血版模型,理论上坚持不到9分钟就会耗尽电池;如果通过蒸馏,将满血版模型压缩到更小尺寸,此时的精度损失又可能满足不了智能水平的要求。

终端是实现数字智能和生命智能自由交互的重要接口,持续帮助人类拓展生产能力的边界。当下,终端智能面临着“能效-空间-智能”的不可能三角:以DeepSeek-R1为例,其参数规模高达6710亿,超出了大部分笔记本电脑的内存容量;即使勉强在一台笔记本电脑上成功运行满血版模型,理论上坚持不到9分钟就会耗尽电池;如果通过蒸馏,将满血版模型压缩到更小尺寸,此时的精度损失又可能满足不了智能水平的要求。

 

针对上述挑战,7月24日,无问芯穹发布终端本征大模型Megrez2.0,它在实现21B参数,也就是云端级智能水平的同时,将实际计算量控制在3B、内存占用控制在7B规模,从而可以完美地适配当下的各类终端设备,成功打破了终端“能效-空间-智能”的不可能三角。

 

模型链接:

https://www.modelscope.cn/models/InfiniAI/Megrez2-3x7B-A3B-Preview/summary

image.gif 编辑

image.gif 编辑

终端本征架构

打破“能效-空间-智能”的不可能三角

传统稠密模型在端侧的黄金尺寸是3B,这个尺寸即可以较好的契合端侧有限的算力和存储,又具有基础的智能水平。但若继续增大尺寸,端侧的推理速度会快速下降。

 

如何让3B的算力发挥更大的智能?主流的方式是MoE,即通过参数冗余和动态激活,为模型精度加杠杆。例如一个总参数量21B,激活参数量3B大小的模型,虽然只有3B计算量,但理论精度潜力高达21B,实际也有7~14B的精度表现。但这21B的总参数量对于端侧太过巨大,如果全部放在外存,外存较低的带宽速率会带来Decode速度指数级下降,而如果限制模型激活参数的locality将部分参数放入内存,又会与MoE的动态多样性与平衡性相违背,带来精度下降。

 

无问芯穹本次提出的终端本征架构,引入了重参数机制,将若干个相邻MoE层划成一组,复用Expert专家参数。这样一个原本30层MoE层的模型,原始总参数量21B。现在每3层共享参数相互复用,模型的实际总参数量下降到21/3即7B大小,但激活可用的专家池空间仍为21B。

 

此外,本次发布的Megrez 2.0为Preview版本,虽然训练数据量只有5T Tokens,但已表现出优异的精度潜力。相较于国内外主流的端侧模型,我们的模型速度相比同内存占用的模型快50%,精度比同尺寸稠密模型提升36%,内存则是比同精度模型节约75%,真正做到高能效、少内存、高智能。

 

Benchmark

Megrez2-3x7B-A3B-Preview

Qwen3-8B

Phi-4-mini

MMLU-Pro

67.6

-

52.8

IF-Eval

80.2

83

68.6

 

终端本征智能应用落地

打破AI的时空能动性边界

 

当端侧级算力撬动起云侧级模型的智能水平,智能体等AI应用将得以在端侧释放更大的能动性。Megrez2.0加持的终端设备,代理任务处理准确率高达95%,复杂代理任务端侧处理时间只需不到3分钟。此外,Megrez2.0还通过巧妙的工程设计,赋予终端设备更强的能动性,使设备在用户无感知的休眠时段里,也能持续创造价值。

 

发布会现场,Megrez2.0的研发团队为大家带来了一个令人激动的演示——用户在电脑合盖之前给出语音指令“整理今日会议记录”。电脑合盖后,系统自动调度闲置CPU周期执行后台任务,等任务完成后,则自动释放内存并转入待机。唤醒设备时,整理好的会议纪要已完整呈现在电脑上,算力亦能瞬时恢复满血状态,并且全程无唤醒、无联网、无发热。

 

Megrez 2.0 坚信,端侧智能体蕴藏着无限可能。它的推出,旨在解锁端侧智能的全新图景:让云端级智能真正落地于端侧设备。由此,智能体等先进 AI应用得以在用户指尖、设备本地获得更多生长空间,随用户个性而进化捕捉用户更多偏好并完成智能自主进化,释放前所未有的能动性——自由、高效且无处不在。

目录
相关文章
|
9月前
|
机器学习/深度学习 存储 缓存
115_LLM基础模型架构设计:从Transformer到稀疏注意力
大型语言模型(LLM)的架构设计是其性能的核心决定因素。从2017年Transformer架构的提出,到如今的稀疏注意力和混合专家模型,LLM架构经历了快速的演进。本文将全面探讨LLM基础架构的设计原理,深入分析Transformer的核心机制,详细介绍稀疏注意力、MoE等创新架构,并展望未来架构发展方向。通过数学推导和实践案例,为构建高效、强大的LLM提供全面指导。
1233 0
|
9月前
|
机器学习/深度学习 自然语言处理 算法
48_动态架构模型:NAS在LLM中的应用
大型语言模型(LLM)在自然语言处理领域的突破性进展,很大程度上归功于其庞大的参数量和复杂的网络架构。然而,随着模型规模的不断增长,计算资源消耗、推理延迟和部署成本等问题日益凸显。如何在保持模型性能的同时,优化模型架构以提高效率,成为2025年大模型研究的核心方向之一。神经架构搜索(Neural Architecture Search, NAS)作为一种自动化的网络设计方法,正在为这一挑战提供创新性解决方案。本文将深入探讨NAS技术如何应用于LLM的架构优化,特别是在层数与维度调整方面的最新进展,并通过代码实现展示简单的NAS实验。
456 0
|
9月前
|
机器学习/深度学习 人工智能 缓存
面向边缘通用智能的多大语言模型系统:架构、信任与编排——论文阅读
本文提出面向边缘通用智能的多大语言模型(Multi-LLM)系统,通过协同架构、信任机制与动态编排,突破传统边缘AI的局限。融合合作、竞争与集成三种范式,结合模型压缩、分布式推理与上下文优化技术,实现高效、可靠、低延迟的边缘智能,推动复杂场景下的泛化与自主决策能力。
812 3
面向边缘通用智能的多大语言模型系统:架构、信任与编排——论文阅读
|
10月前
|
数据采集 机器学习/深度学习 搜索推荐
MIT新论文:数据即上限,扩散模型的关键能力来自图像统计规律,而非复杂架构
MIT与丰田研究院研究发现,扩散模型的“局部性”并非源于网络架构的精巧设计,而是自然图像统计规律的产物。通过线性模型仅学习像素相关性,即可复现U-Net般的局部敏感模式,揭示数据本身蕴含生成“魔法”。
404 3
MIT新论文:数据即上限,扩散模型的关键能力来自图像统计规律,而非复杂架构
|
10月前
|
机器学习/深度学习 人工智能 运维
云架构不是养祖宗,智能运维教你省心又省钱
云架构不是养祖宗,智能运维教你省心又省钱
256 2
|
11月前
|
编解码 文字识别 自然语言处理
Dots.ocr:告别复杂多模块架构,1.7B参数单一模型统一处理所有OCR任务22
Dots.ocr 是一款仅1.7B参数的视觉语言模型,正在重塑文档处理技术。它将布局检测、文本识别、阅读顺序理解和数学公式解析等任务统一于单一架构,突破传统OCR多模块流水线的限制。在多项基准测试中,其表现超越大参数模型,展现出“小而精”的实用价值,标志着OCR技术向高效、统一、灵活方向演进。
1015 0
Dots.ocr:告别复杂多模块架构,1.7B参数单一模型统一处理所有OCR任务22
|
11月前
|
机器学习/深度学习 人工智能 监控
大型动作模型LAM:让企业重复任务实现80%效率提升的AI技术架构与实现方案
大型动作模型(LAMs)作为人工智能新架构,融合神经网络与符号逻辑,实现企业重复任务的自动化处理。通过神经符号集成、动作执行管道、模式学习、任务分解等核心技术,系统可高效解析用户意图并执行复杂操作,显著提升企业运营效率并降低人工成本。其自适应学习能力与上下文感知机制,使自动化流程更智能、灵活,为企业数字化转型提供坚实支撑。
671 0
大型动作模型LAM:让企业重复任务实现80%效率提升的AI技术架构与实现方案
|
12月前
|
人工智能 物联网 测试技术
智能化测试基础架构:软件质量保障的新纪元
本文介绍了智能化测试基础架构的核心构成与优势。该架构融合AI、领域工程与自动化技术,包含智能测试平台、测试智能体、赋能引擎和自动化工具链四部分,能自动生成用例、调度执行、分析结果,显著提升测试效率与覆盖率。其核心优势在于实现专家经验规模化、质量前移和快速适应业务变化,助力企业构建新一代质量保障体系。建议从构建知识图谱和试点关键领域智能体起步,逐步推进测试智能化转型。
|
存储 边缘计算 数据处理
面向智能医疗的边缘计算与云计算融合架构的设计与实现
边缘+云混合部署架构正在为AIoT与医疗领域带来前所未有的技术变革。通过这种架构,能够实现对海量数据的实时处理和深度分析,提升业务响应速度和效率,同时在保障数据安全的基础上,优化系统的可扩展性和可靠性。随着技术的发展,边缘+云架构的应用场景将愈发广泛,未来必将在更多领域内发挥巨大的潜力。
|
人工智能 监控 API
MCP中台,究竟如何实现多模型、多渠道、多环境的统一管控?如何以MCP为核心设计AI应用架构?
本文产品专家三桥君探讨了以 MCP 为核心的 AI 应用架构设计,从统一接入、数据管理、服务编排到部署策略等维度,系统化分析了 AI 落地的关键环节。重点介绍了 API 网关的多终端适配、数据异步处理流程、LLM 服务的灰度发布与 Fallback 机制,以及 MCP Server 作为核心枢纽的调度功能。同时对比了公有云 API、私有化 GPU 和无服务器部署的适用场景,强调通过全链路监控与智能告警保障系统稳定性。该架构为企业高效整合 AI 能力提供了实践路径,平衡性能、成本与灵活性需求。
824 0

热门文章

最新文章