异构计算

首页 标签 异构计算
# 异构计算 #
关注
20484内容
|
15天前
| |
来自: Qoder CN
把视频换脸放进浏览器:一次 WebGPU 推理链路的工程化实践
本文详解浏览器端视频换脸的WebGPU工程实践,涵盖数据转换优化、ROI裁剪、串行Session初始化、Transferable内存管理、双向光流校验、时序目标匹配、遮罩后处理、模型版本控制、主动内存释放及深度任务取消等11项关键挑战,揭示“能运行”到“可持续使用”的真实路径。
AI 应用软件的开发费用
AI应用开发费用差异大:PoC仅3-15万元,企业级可达200万+。除一次性研发费外,还需持续承担模型算力、Token消耗等动态成本。人力占70%以上,公有云API按量计费,私有化部署需GPU投入。合理选型、混合路由与语义缓存可有效控本。(239字)
数字孪生项目开发技术对比
数字孪生选型核心在于平衡:Web原生(Three.js/Cesium)以低并发成本、高兼容性支撑日常运维;UE5云流化依托Nanite/Lumen实现影视级画质与物理仿真,适合展厅与推演。二者正走向混合架构。(239字)
银行敢用 AI 审批贷款,凭什么让我相信它?——金融合规时代,可解释 AI 才是算法的“身份证”
银行敢用 AI 审批贷款,凭什么让我相信它?——金融合规时代,可解释 AI 才是算法的“身份证”
|
17天前
|
阿里云ECS、GPU云服务器、轻量服务器与AI云产品全解析:配置、价格与性能深度测评
阿里云ECS(弹性计算服务)是阿里云核心计算产品,提供从入门到企业级的全系列实例,具备弹性伸缩、VPC专有网络、安全组、快照备份、自定义镜像等企业级能力,性能稳定、安全性高、扩展性强,可支撑生产环境各类业务。
基于 YOLO11 的睡岗检测训练实践:从数据集到云上工程化管理
本文介绍基于YOLO11的睡岗检测实战:从100张监控抽帧数据出发,完成YOLO格式标注、训练调优与云上工程化管理(OSS存储+版本控制+Docker训练),覆盖安全生产、客服中心等场景,助力7×24小时智能值守落地。(239字)
|
17天前
| |
来自: 视觉智能
浏览器端 AI 视频人物描边实践:MODNet、SlimSAM、MediaPipe 与光流融合方案
Timeline Studio 实现浏览器端AI视频人物描边:融合YOLOS检测、MODNet抠像、MediaPipe清理、SlimSAM修复与Farneback光流传播,在WebGPU/WASM下本地运行,无需上传隐私视频,支持移动端与实时材质渲染。
|
17天前
|
从 GPT-2 到 Kimi K3:22580 倍规模增长背后的架构演进
本文深度解析Kimi K3技术演进路径:从GPT-2出发,历经Linear Attention、DeltaNet、Gated DeltaNet、Kimi Linear,最终抵达2.8万亿参数的Kimi K3。全文以“状态管理”为主线,揭示架构迭代本质——非单纯堆参,而是持续优化记忆存储、动态更新与选择性读取机制,兼顾效率与表达力。
|
17天前
| |
揭秘大模型通用8192维度奥秘:千亿大模型为何统一采用8192隐层维度的真相.183
本文深度解析大模型隐藏层维度为何普遍采用8192:它并非随意设定,而是Transformer数学结构、GPU张量核心(Tensor Core)原生适配、2¹³二进制对齐、多头注意力整除(如128头×64维)、SwiGLU 4倍缩放、KV缓存与FlashAttention分片效率、分布式训练负载均衡等数十项硬约束共同博弈的最优解,在语义表达力、算力利用率、显存开销与部署成本间达成极致平衡。
聚搜云运维团队:PAI大模型推理吞吐量优化,批处理、KV Cache与实战指南
当单卡推理延迟已经压到个位数毫秒,却怎么也突破不了每秒几十个请求的吞吐天花板,问题往往不在模型本身,而在于你还没摸清PAI大模型推理吞吐量优化方法的切入点。不少团队上线后GPU利用率常年徘徊在30%上下,算力被访存等待和无效填充吃掉大半,只有看透这些根因,优化才有方向。
免费试用