智算专线选型实践:大模型训练上云,专线带宽与稳定性怎么定?
本文深入剖析大模型训练上云的网络瓶颈,指出专线选型不能只看带宽,而需统筹带宽、时延、丢包率与拓扑收敛比四大维度,并提供可落地的估算方法、稳定性红线及四步决策框架,助力高效构建智算网络基础设施。(239字)
一份完整的 SD-WAN 组网方案包含哪些模块?选型评审清单参考
这是一份面向企业IT决策者的SD-WAN组网评审指南,涵盖接入边缘、传输链路、控制管理、应用策略四大模块,共16项可勾选评审点,助力多分支、多云场景下科学选型,规避常见盲区与遗漏。(238字)
LLM Gateway科普:大模型统一接入与治理,究竟解决了什么
LLM Gateway是大模型时代的上下文感知治理中间件,解决多模型规模化使用中的统一接入、密钥管理、成本归因、流控配额与可观测性难题。它非简单代理,而是专为SSE流式响应、Token计量、语义路由设计的智能调度层,助力团队从“能调用”迈向“管得住、看得清、控得准”。
分布式推理网络怎么设计?从推理集群组网到跨节点协同实践
本文详解大模型分布式推理网络设计,涵盖单节点瓶颈识别、组网拓扑选择(主从/P2P/PD分离)、KV缓存传输优化、任务切分调度及结果聚合验收,强调“先拓扑、后框架”,避免训练经验误用,提升TTFT与吞吐效能。(239字)
一套可落地的 SD-WAN 方案包含哪些技术组件?架构设计与网络割接流程
本文详解可落地的SD-WAN方案,聚焦“四大技术组件(控制器、编排器、边缘设备、混合链路)+一套标准化割接流程”。强调控制与转发分离架构,以工程交付视角拆解组件协同逻辑与零中断割接六步法,助力网络工程师高效落地多分支组网。
异地容灾组网搭建步骤:主备数据中心链路冗余与自动切换配置
本文详解异地容灾组网核心实践:以RPO/RTO为起点,通过六步法实现主备链路冗余与自动切换;结合新国标GB/T 20988—2025要求,强调全生命周期管理与定期演练;并介绍FusionWAN NaaS如何将容灾网络变为弹性订阅服务,助力金融、制造等行业实现秒级切换、高可用与合规闭环。(239字)
聊聊 AI 行业网络选型:时延、带宽、丢包之外,还应看哪些指标
本文剖析AI网络选型中常被忽视的三大关键指标:网络可视化与故障定位能力、匹配业务弹性的成本结构、跨地域跨集群协同能力,指出仅关注时延、带宽、丢包已无法保障AI训练与推理效能,强调需从“链路通不通”转向“性能好不好、问题能不能快速定位”。
推理网络是什么?大模型推理服务对网络提出了哪些新要求
本文深入剖析大模型推理网络的核心诉求,对比训练与推理在网络延迟、IOPS、协议效率、拥塞控制及通信解耦五大维度的本质差异,提出可量化的技术指标(如P99≤10ms、IOPS≥100K)与企业自检框架,助力构建“答得快、答得稳、扛得住并发”的推理基础设施。(239字)
本地机房与多朵云并存,混合云专线的3类典型接入场景
本文详解混合云专线三大典型场景:单云接入重在判断“要不要拉专线”,多云接入关键在“如何避免重复拉线”,多分支并存则聚焦“统一调度与组网”。涵盖成本构成、技术参数(时延<5ms、带宽独占)、主备冗余及中立骨干网方案,助力企业科学选型。(239字)
2026 软件定义广域网走向何方?AI 原生网络与 SD-WAN 的技术融合趋势
本文聚焦2026年SD-WAN发展趋势,剖析AI原生网络如何重塑广域网架构:从MPLS替代迈向SASE入口,融合智能选路、AIOps、零信任与多云统一策略,助力企业实现“连接→智能→原生”的演进跃迁。(239字)
车企网络方案里的专线、SD-WAN与云互联分别解决什么问题
本文解析车企网络中专线(保稳定合规)、SD-WAN(提效率降成本)、云互联(促多云协同)三类连接的定位、边界与组合逻辑,强调“问题驱动选型”,助力IT架构师在智驾回传、门店上线、多云训练等场景科学决策。(239字)
Token 套餐时代:企业 AI 用量计量与费用归因实践
2026年9月,三大运营商试点Token套餐,拟将Token列为语音、流量、宽带之后的“第四通信计量单位”。本文聚焦企业级AI调用计量实践,详解调用归属、用量统计、费用分摊与对账要点,强调原始日志、估算成本与实际账单须分离管理。
AI 已经会写论文了,Textira 为什么还要重做一遍科研工作流?
AI 已经能写摘要、改论文、生成 LaTeX,但真正完成一篇论文,研究者仍要在实验数据、参考文献、写作工具和投稿要求之间反复切换。Textira 想解决的不是“让 AI 更会写”,而是让 AI 真正进入科研工作流:理解已有论文、实验结果和目标期刊,在不破坏事实、引用和结构的前提下继续修改和完成论文。当生成文字已经不再稀缺,科研 AI 的下一场竞争,或许才刚刚开始。
用“批次谱系 + 称量防错”设计一个食品车间 MES 数据模型(附核心表与数据流)
食品行业 MES 和机加工 MES 最大的不同,不是界面,而是数据模型。本文从一个可落地的角度,拆一下食品车间怎么做批次双向追溯、投料防错和电子批记录,并给出几张核心表的设计思路。适合做工业软件、IoT 采集、ERP-MES 集成的开发者参考。
我给 AI 写的规矩只有一句话,还是撞了两次号
同事翻我的配置目录:一堆 SKILL.md 加一堆 .py,问「这不都是自动化吗」。区别大到放错位置会出事故。我那条占号规矩清清楚楚只有一句,还是撞了两次——说明书管得了怎么做,管不了两个人同时做。
轻应用表单高峰期提交丢失:前端排队、异步削峰与可靠投递落地实践
活动高峰期表单提交丢失本质是高并发写入问题。本文搭建三层可靠提交链路:前端用串行队列、指数退避和本地暂存稳住重复流量,后端用消息队列把瞬时洪峰削成匀速落库并以消费者并发反压保护数据库,再用生产确认、消费ACK、clientReqId幂等唯一约束和死信队列保证消息不丢不重,附代码与5个踩坑点。
⑤ 契约消费追踪双重闭环验证:机器闭环 + 角色闭环
验证编译管线双重闭环:机器闭环确保YAML契约编译的四种格式被加载执行并拦截语义漂移;角色闭环确保规则持续被消费、反馈、迭代。回答"规则写完后真的在工作吗"。
在线教育视频卡顿怎么治:弱网自适应、断线重连与播放质量监控实践
在线教育课程视频卡顿常被简单归为用户网不好。本文把播放体验工程化拆解为弱网自适应、断线重连、质量监控三层:用多码率转码与带迟滞的ABR算法适配弱网,用指数退避重连和断点续播应对网络闪断,并通过首帧时间、卡顿率、重连成功率等QoE指标实现可观测,附可复用代码与5个踩坑点。
终端光学泄密风险分析与防护落地实践
企业在建设 DLP、外设管控等数据防泄漏体系时,大多聚焦文件拷贝、网络外传等数字泄密通道,手机拍摄屏幕带来的光学泄密常常被忽略。该类窃密行为不产生文件复制、不经过网络传输,传统安全手段很难感知拦截。本文分析光学泄密威胁特征,拆解屏幕水印、截屏水印、防拍照锁屏的技术原理、能力边界,结合混合操作系统内网场景给出可落地部署方案。
终端泄密不止"文件"一条路:外设、网络、应用的三层边界管控实践
上一篇介绍了以透明加密为核心的文档防泄密方案。但实际攻防中,泄密通道远不止"文件本身"——U盘、打印机、网络、聊天工具、未授信应用都是数据外流的管道。本文基于迪康端点安全一体化管理系统的落地实践,分享一套**"边界管控 + 审计兜底"**的终端外流通道治理方案,覆盖外设管控、网络管控、应用管控与行为审计四块,并给出分级配置与联动建议。
从 AI 写作到科研工作台,Textira 正在重新连接论文从实验到投稿的流程
随着大模型逐渐进入文献阅读、实验分析、科研绘图和论文写作,AI 科研工具正在从单点的“AI Writer”走向更完整的 Research Workspace。本文以 Textira 为例,讨论如何以一项 Research 为基本单位,连接知识库、文献、实验、数据、论文与投稿,并进一步探讨 MCP、API 与 Research Agent 可能带来的科研工作流变化。
Agent 审计:从海量噪音中捞出真风险
本文介绍阿里云Agent观测平台AgentLoop的审计实践,聚焦Coding Agent安全风险识别。强调构建完整行为事实底座,通过“低保真信号→上下文语义判定→高保真事件”三级链路,精准定位凭证泄漏等真风险,支持按应用、凭证、边界多维下钻与一键证据溯源,提升安全处置效率。
门店预约系统容量设计:时段库存、防超卖与履约提醒闭环实践
门店预约系统真正的难点是容量管理。本文基于连锁门店改造实践,搭建三层体系:时段容量层把服务能力建模成可扣减库存并从排班反推产能,并发防超卖层用条件原子UPDATE和锁定TTL机制保证高并发零超卖,履约闭环层通过分层提醒和爽约治理提升到店率,附容量建模、原子扣减SQL、履约度量代码与5个踩坑。
画画 25 美元,挑毛病 50 美元,验证比生成贵的那笔账没人算
AI 画漫画一个月 25 美元,够画到手软。挑毛病的那道工序另花 50 美元,因为看出图有毛病比把图画出来难得多。生成是便宜的,验证是贵的,所有一分钟出活的演示都默契地没算这笔账。
终端数据出口收敛实践:USB、打印、网盘七类通道的管控设计与灰度
文件加密解决的是「文件出去了打不开」,解决不了「有权限的人主动把数据带走」。本文换个视角:不去管文件本身,而是把终端上所有可能带走数据的通道逐条盘出来,按部门分三档收敛,配好例外申请与审计留痕,并给出一份能直接照着跑的灰度节奏与验证清单。
文档加密防护的局限:终端行为审计在异构内网环境下的落地思考
在政企数据防泄露建设中,文档透明加密可以有效防护静态涉密文件,但大量内部泄密并非外泄完整加密文档,而是剪贴板复制片段、IM 聊天外传、向公有 AI 投喂业务资料等行为类风险。本文从工程实践角度,剖析文档加密的防护盲区,梳理终端行为审计核心能力、适用边界,结合等保合规要求给出异构终端环境下的部署建议,供内网安全运维人员参考。
⑤ 消费格式差异:同一份契约的四角色消费格式
同一份YAML契约编译为Prompt前缀、JSON Schema、走查清单、CI规则四种格式。AI工程师注入对话约束,前端校验Props,设计师走查,负责人看消费数据。不是语法差异,而是工作流入口差异——同一语义嵌入四种习惯,变更自动同步。
AI 网关怎么选?2026企业AI接入方案(附四类对比)
本文探讨企业AI接入的核心挑战:员工与Agent正绕过管控使用AI,导致数据泄露风险激增。作者基于实战经验,系统解析AI网关的定位、四类主流方案(应用层/安全DLP/ API聚合/网络层)及选型逻辑,强调“闸门位置决定治理实效”,主张按岗位风险与现有IT底座分层部署,实现安全、合规与效率的平衡。(239字)
冗余为什么会失效:从谷歌云事故谈故障域、可用度上限
本文深度复盘2026年谷歌云us-central1因维护误操作致全光纤中断的事故,揭示“冗余失效”的本质——共因故障使可用度被封顶。系统剖析四层故障域、三平面隐藏耦合、爆炸半径控制、MTTR自愈闭环及容灾成熟度分级,并给出混合云接入层可落地的韧性工程方案。(239字)
产线设备数据采集怎么做:协议对接、点位规划与踩坑总结
本文直击制造业MES落地痛点,详解设备数据采集实战:从三类设备协议对接(OPC UA/网关转换/外置传感),到“少而准”的业务驱动点位规划,再到秒级回溯、实时报警的数据闭环。附真实踩坑经验——断线缓存、统一校时、命名规范,助你避开数据空转陷阱。(239字)
百万用户,一人一 Topic:百炼资产中心用 RocketMQ LiteTopic 实现隔离与限流
当业务的并发单元是“用户”时,消息系统的治理单元也应该是“用户”。RocketMQ LiteTopic 把“百万用户 × 各自一条消息流”的业务模型直接变成消息系统的原生原语,整个过程中业务侧没有自建任何路由层与限流层。
从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考
两个月的 Agent 开发实践沉淀,从第一性原理出发,探讨 Agent 的本质、当前多 Agent 协作架构的不足,以及如何借鉴人类组织经验设计真正的 Agent Team 机制。
AI Agent 时代,需要的不是更多数据,而是一个语义层
AI Agent 缺的不是数据而是系统地图。UnifiedModel 开源语义层将资产、数据与关系组织为可查询对象图,实验显示旗舰模型准确率提升 10-20%。它助 Agent 按对象读数、沿关系定位根因,真正看懂复杂系统。
论坛剧透丨当企业有 1000 个智能体后怎么跑怎么管?
2026 云栖大会“Agent 工程化:AgentCore 让企业智能体走进生产”论坛 , 将聚焦企业智能体规模化落地,联合产学研各界专家与先锋企业,全新发布智能体构建和治理平台 Alibaba Cloud AgentCore 及企业级落地白皮书,围绕 Agent 构建、运行、治理、协作、评估、优化全生命周期,为企业将智能体安全、稳定地推向规模化生产提供实践指南,同时结合丰富的客户真实案例,展示阿里云 AgentCore 如何在客户服务、智能研发、自动化运营等场景带来效率提升和业务创新。
模型后训练视角:DeepSeek Harness 把企业进化做进了架构
用后训练的视角读 DeepSeek Harness:它把环境塑形和轨迹沉淀做进了架构,把权重塑形留给了厂商。我们用自进化 POC 验证这条链通不通,又断在哪里。
飞牛NAS部署DeepSeek Harness:Nginx反代+ZeroNews HTTPS隧道+BasicAuth保姆级教程
本文介绍如何在飞牛NAS上通过Nginx+DeepSeek Harness容器部署,并借助ZeroNews HTTPS隧道与BasicAuth安全发布至公网。方案解决官方API仅信任回环地址导致的403问题,支持域名访问、HTTPS加密及IP黑白名单、地域围栏等多重安全策略,实现安全可控的远程AI开发环境。(239字)
网页CAD如何在web端实现AutoCAD的圆弧功能(web cad二次开发)
本文详解MxCAD Web CAD开发:先介绍开箱即用的内置绘图命令(如Mx_Line、Mx_Arc等),再以“圆弧绘制”为核心案例,深入剖析七种专业模式(三点法、起点-圆心-端点、起点-端点-半径等)的API实现逻辑与几何计算,最后提炼出“交互→计算→实体”三步通用开发范式。
数据防泄密实践:拆解文档透明加密的能力与落地坑点
企业内部文档泄露事件频发,终端侧是数据泄露的重要来源。传统依靠文件夹权限、外设封禁的防护手段存在较多绕过风险。透明加密作为终端数据防泄密主流技术,并非简单对文件做加密处理,需要覆盖多模式策略、细粒度权限、内部逻辑隔离、受控外发、离线办公、全链路审计等能力。本文从工程实践视角剖析整套防护体系的技术要点与落地误区,文中部分功能设计参考迪康端点安全一体化管理系统,仅供技术研讨,不构成选型采购建议。
AI时代,程序员拼的到底是什么
最近跟几个做技术管理的朋友聊招聘,听到一个共同的说法:面试里"手写算法""默写API"这类环节,权重在明显下降。 不是不考了,是考了也测不出太多东西——Vibe Coding 普及之后,一个初级工程师借助 AI,也能在半小时内写出过去需要三五年经验才能写顺手的代码。语法熟练度、样板代码的编写速度、对某个框架 API 的记忆量,这些曾经用来区分"生手"和"熟手"的硬指标,正在被 AI 大规模拉平。
终端文档防泄密方案落地实践:从透明加密到零信任的完整闭环
文档是企业的核心资产,而终端是文档流转最密集、最难管控的环节。本文基于实际落地经验,分享一套以**透明加密为核心、受控外发为补充、审计溯源为兜底**的终端文档防泄密方案,覆盖加密模式选择、落地加密、外发包管控、水印溯源、流转追溯与零信任联动等关键实践,并给出分阶段落地建议,供正在建设或优化终端数据安全体系的技术团队参考。
【Azure Redis】Redis 指标 ClockSkewSeconds 解读:含义、读数与时钟偏差的影响
《ClockSkewSeconds 解析》:详解 Redis 监控中时钟偏差指标的含义——反映节点与参考时钟的时间差(秒级),非请求耗时;阐明其对 Key 过期、日志关联及分布式一致性的影响,强调稳定时间比瞬时偏差更关键。
AI加持后2天时间将公司的运维自动化提高了一个层次
近期工作安排包括自动化测试、自动化运维、自动化运营和安全等一些工作。自己做产品、自己做设计、自己做开发、自己验收上线还是挺爽滴。 这其中工作简单的就是自动化运维。但我今天真正要讲的不是做了什么,或者用了什么技术,这些都不是核心问题。核心是面对一句话需求,要怎样去思考。
【Azure Function】NodeJS Function大批量写入到Redis遇见丢失数据情况的分析
Azure Functions 中批量写 Redis 时,看到 Invocation 已完成,不代表每个 Redis SET 都完成了。如果代码用 callback 调用 client.set(),随后立即执行 client.quit() 或直接返回,Function Runtime 可能认为本次执行已经结束,但 Redis 写入还在事件循环里排队。我的建议很明确:所有外部依赖调用都必须 await,批量写入要么顺序等待,要么用受控并发等待全部 Promise 完成。
阿里云亮相开源 AI 三大顶会!我们上海见
2026 年 9 月 5 日至 9 日,AGNTCon + MCPCon、PyTorch Conf China、KubeCon + CloudNativeCon China 等开源 AI 顶会即将在上海举办。 阿里云技术专家们将在大会上,为广大开发者带来 Agent 运行时、模型训练和推理、云原生基础设施等领域的开源项目最新进展分享。
Agent 做了这么多轮重构,企业到底该留下什么?
本文整理自第 10 届 AI + 研发数字峰会(AiDD)北京站 TOP10 最佳演讲议题之一《Agent 开发范式演进:简化多源实时上下文构建》。
经验自进化:自动挖掘经验资产,消融实验验证真实收益丨AgentLoop 数据飞轮实践(五)
本文介绍AgentLoop经验自进化实践:从运行轨迹自动挖掘成功与失败模式,经Skill召回并注入上下文。文章详解接入验证流程,并通过消融实验优化召回策略,降低耗时、成本、Token消耗和工具调用,让Agent持续迭代。
实验:回测、离线实验平台与题目级 Rubric丨AgentLoop 数据飞轮实践(四)
不经验证的优化是空头支票。Agent的任何优化都需要经过评估效果,验证真正有改善并且没有回退。本文介绍AgentLoop如何用实验验证智能体优化效果:建立回测计划,结合本地实验平台,并以定时调度、实验大盘和题目级Rubric跟踪趋势,形成调优闭环。
评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)
Agent 跑得怎么样?人工抽检又贵又慢,还沉淀不成标准。这篇带你从零搭起可量化、可解释的评估体系:让 AI 把黄金指标拆成 Rubric,装进评估器、跑到评估任务——把"好不好"变成分数,把"为什么不好"变成证据。
AI Coding 的观测与科学降本:从一次 Trace 到自动调优闭环
本文聚焦AI Coding成本瓶颈,指出Token浪费源于上下文膨胀、工具输出、重复探索与无效重试。文章介绍AgentLoop从采集、观测、评估、归因到调优和实验的数据飞轮,通过统一轨迹、经验注入与同样本验证,在质量不降前提下降低任务成本。
从查账单到运营云成本:STAROps 如何把 FinOps 跑成一条闭环
STAROps 面向企业云成本治理,通过自然语言完成账单分析、费用归因、异常下钻、资源水位判断与优化建议,并以周期巡检和长期任务持续跟踪治理进展,帮助企业实现从成本可见、原因可解释到优化可执行的 FinOps 闭环。
云原生
阿里云拥有国内全面的云原生产品技术以及大规模的云原生应用实践,通过全面容器化、核心技术互联网化、应用 Serverless 化三大范式,助力制造业企业高效上云,实现系统稳定、应用敏捷智能。拥抱云原生,让创新无处不在。