分层配额显存共享方案:RTX4090运行ChatGLM2/3双模型,显存池化应用实践.194
本文提出显存池化分片调度技术,解决单张RTX4090(24GB)无法同时运行ChatGLM2-6B与ChatGLM3-6B的难题。通过将显存切分为64MB Chunk,划分“保底锁定”(承载权重,不可抢占)与“弹性共享”(承载KV缓存,可抢占回收)双区,并引入优先级抢占、后台碎片合并与统一适配封装,实现两模型逻辑隔离、物理共用,显存利用率提升超50%,无需额外购卡。
解密Qwen3三连发:强化学习新算法GSPO!
强化学习(RL)是提升语言模型推理与问题求解能力的关键技术。然而,现有算法如 GRPO 在长期训练中存在严重不稳定性,限制了性能提升。为此,我们提出 **Group Sequence Policy Optimization (GSPO)**,通过在序列层面定义重要性比率并进行优化,显著提升了训练效率与稳定性。GSPO 在 MoE 模型训练中表现出色,无需依赖复杂策略即可实现高效训练,简化了 RL 基础设施。该算法已成功应用于 Qwen3 系列模型,推动 RL scaling 边界,释放模型潜能。
智能体领航员:2026 在数字化海洋中寻找个体的节奏与尊严
2026年,智能体领航员重塑生活:从无感通行到社交共情,从守护老人儿童到捍卫数字主权。它不仅是工具,更是调频人与世界的“诗意中介”,在算法洪流中帮我们夺回时间、尊严与人性微光。
大模型应用:与传统数据库融合:打造关系型数据库MySQL的向量检索能力.31
本文详解MySQL向量检索能力演进:8.4.0+支持原生VECTOR类型、HNSW索引与VECTOR_DISTANCE函数;8.0.x则可通过“字符串存向量+自定义函数”兼容实现。涵盖技术原理、版本差异、架构设计及可落地的完整实战方案。
ChenRT:基于变长编码与稀疏离群点补偿的大模型微观残差量化架构
ChenRT架构,针对大模型端侧量化中离群点导致的精度坍塌问题,创新采用“宏观分组+微观稀疏残差补偿”双轨设计,结合VarByte差分索引压缩,在Apple Silicon上仅增6.8%存储即实现2.38% MAE精度回升,兼顾高精度与低开销。
开源最新 Llama 3.1 系列大模型抢先体验
Meta开源Llama 3.1系列模型,含4050亿参数“超大杯”版本。阿里云百炼率先上架全系列,并为新老用户享30天100万tokens免费算力。模型广场现开放体验,欢迎试用与反馈。涵盖80亿、700亿、4050亿参数版本,上下文长度最大可达128K tokens,支持多语言。立即体验Llama 3.1的强大能力!
智能体领航员:重塑创造力与生命资产的边界
2026年,智能体领航员从助手蜕变为共创者,助力人类摆脱生存劳役,迈向生命表达的新纪元。通过创意协同、财务主权与智慧传承,它捍卫个体创造力与数据主权,推动“知识即财富”的生命资产体系建设。在硅基时代,守护碳基的灵感原生、数据独立与不完美之真,让文明在自由中绽放。
人工智能(AI)仿真攻击 CEH-TrapOrbit-PUF 面向硬件防克隆的AI驱动三层融合行为认证方法
本文提出CEH-TrapOrbit-PUF技术,首创三层融合动态行为认证:设备身份层标定唯一性、挑战预测层(岭回归)阻断重放、动态行为层(L1波动判据)抵御AI建模攻击。仿真实验显示,对重放、AI代理、跨设备冒充攻击拦截率分别达100%、99.48%、99.79%,FAR均<4.5%,为硬件防克隆提供无密钥、抗AI的新范式。(239字)