TID质量竞争大会分享议题|科大讯飞:端到端大模型效果评测,从人工周级到自动化天级

简介: 大模型落地加速,效果评测面临效率低、标准不一、端到端难评估等挑战。科大讯飞陈明将在TID大会分享《端到端大模型效果评测》实践,揭秘如何实现从人工周级到自动化天级的工程突破,覆盖内容创作等真实场景。

大模型应用正在加速进入真实业务场景,随之而来的一个重要问题是:

大模型效果到底该怎么评?

过去,很多评测工作依赖人工经验完成。面对少量样本、单一场景时,这种方式还能支撑;但当大模型应用开始进入内容创作、智能问答、业务助手、复杂任务处理等场景后,评测需求快速增加,传统人工评测方式开始面临效率、标准和可复用性上的挑战。

在本届 TID质量竞争大会 上,科大讯飞股份有限公司 AI工程院高级测试工程师陈明,将带来议题:

《端到端大模型效果评测:从人工周级到自动化天级的工程实践》

这场分享将围绕大模型效果评测的工程化困境、端到端评测体系建设,以及内容创作等业务场景中的实践经验展开。

对于正在关注AI测试、大模型评测、AI应用质量保障和智能化测试工程建设的团队来说,这是一场非常值得关注的分享。

讲师介绍
陈明,科大讯飞股份有限公司 AI工程院高级测试工程师。

本次在TID质量竞争大会中,陈明将结合大模型效果评测相关实践,分享从人工评测到自动化评测的工程化探索。

议题将重点关注大模型效果评测在真实业务中的痛点、体系化建设思路、典型场景实践,以及评测能力后续演进方向。

为什么大模型效果评测越来越重要?
随着大模型能力不断提升,越来越多业务开始将大模型能力嵌入具体产品和流程中。

但在实际应用中,团队很快会发现: 大模型能生成内容,不代表生成结果稳定可用; 大模型能完成任务,不代表效果可以持续评估; 一次测试效果不错,也不代表后续版本升级后仍然可靠。

尤其在端到端场景中,评测对象不再只是一次模型回答,而可能涉及完整任务链路、用户体验、业务目标和结果质量。

这也让大模型评测从单点验证,逐渐走向更系统化的工程问题。

大模型效果评测面临哪些挑战?
从议题介绍来看,本次分享会重点讨论大模型效果评测中的工程化困境。

其中比较典型的问题包括以下几个方面。

  1. 评测需求快速增长
    大模型应用场景越来越多,评测对象也越来越复杂。

不同业务、不同任务、不同版本,都可能需要进行效果验证。 如果完全依赖人工评测,很容易出现周期长、效率低、响应慢的问题。

这也是议题中提到“从人工周级到自动化天级”的重要背景。

  1. 评测标准不容易统一
    大模型效果评测并不只是判断“对”或“错”。

在很多场景中,生成结果可能涉及准确性、完整性、可读性、业务适配度、用户体验等多个方面。

不同角色对结果的判断标准可能不同,这就需要更清晰的评测框架和统一的评测口径。

  1. 端到端效果更难评估
    大模型应用落到业务中,最终呈现给用户的往往不是一个单独模型能力,而是一整套产品体验。

因此,端到端评测需要关注的不只是模型输出本身,还要关注完整业务流程中的最终效果。

这也是本次议题标题中“端到端大模型效果评测”值得关注的地方。

  1. 评测能力需要持续演进
    大模型应用不是一次上线就结束。

随着模型版本升级、业务场景变化、用户反馈积累,评测集、评测流程和评测能力也需要持续迭代。

从议题介绍来看,本次分享也会涉及线上数据回流、评测集持续进化,以及Skill & Agent评测能力扩展等方向。

本场分享有哪些看点?
看点一:从人工评测到自动化评测的工程化思考
“从人工周级到自动化天级”,是本次议题最直接的关键词。

这背后关注的不只是效率提升,更是大模型评测如何从人工经验走向工程化流程。

对于正在做AI应用评测的团队来说,这部分内容有很强的参考价值。

看点二:端到端效果评测如何支撑业务场景
本次分享会结合内容创作场景进行案例介绍,并涉及旅游规划场景、大版本升级评测等实践内容。

这些场景都具有一定复杂性,不再是简单的单轮问答评测,而更接近真实业务中的大模型应用形态。

通过这些案例,听众可以更直观地理解端到端评测在业务中的价值。

看点三:评测体系如何从工具化走向平台化
从议题介绍来看,本次分享不仅会讲评测流程,也会关注评测框架、混合评测策略、技术架构和评测集演进。

这说明大模型效果评测已经不只是单个工具或单次任务,而是在逐步走向体系化、平台化。

对于正在建设AI质量能力的团队来说,这一点很值得关注。

看点四:Skill与Agent评测能力的后续扩展
随着大模型应用从问答生成走向更复杂的任务执行,Skill与Agent相关评测也会成为新的质量挑战。

本次议题中也提到,后续会关注Skill & Agent评测能力扩展。

这对于正在探索智能体应用、工具调用、多步骤任务执行的团队来说,是一个值得提前关注的方向。

这场分享的价值在哪里?
对于企业和研发测试团队来说,大模型效果评测的价值,不只是判断某一次结果好不好。

更重要的是,它能够帮助团队:

提升评测效率,减少重复人工投入; 统一评测标准,让结果更具参考价值; 支撑版本升级,帮助团队更快识别效果变化; 沉淀评测数据和经验,形成可复用的方法体系; 服务更多AI应用场景,为后续平台化建设打基础。

随着大模型在业务中的使用越来越深入,效果评测也会成为AI应用质量保障中非常关键的一环。

适合哪些人关注?
这场分享适合以下几类人重点关注:

正在做大模型应用落地的研发团队; 关注AI测试和大模型评测的质量团队; 负责智能化测试平台建设的技术团队; 关注内容生成、智能助手、业务Agent效果评估的产品和测试负责人; 希望了解大模型评测工程化实践的研发效能团队。

相关文章
|
1月前
|
人工智能 运维 BI
QoderWork + QoderWake 实战:AI 数字员工的企业级落地与效率革命
企业办公中大量重复性工作正在吞噬团队的创造力。QoderWork CN 作为桌面 AI 办公助手,本地运行、自主规划、安全可控,内置丰富 Skill 覆盖文案写作、幻灯片制作、浏览器自动化等场景;QoderWake CN 作为数字员工平台,全天在线、支持企业私域知识库与自定义扩展。本文从运营团队的实际痛点出发,完整拆解 QoderWork + QoderWake 的企业级落地路径,包含四大典型场景的实战配置、五个真实踩坑案例,以及从试点到推广的完整 SOP。
|
1月前
|
人工智能 缓存 JavaScript
当AI学会自己“探索性测试”,纯手工点点点的QA还能活多久?
本文探讨AI时代测试工程师的生存危机与转型机遇:当AI不仅能生成用例,更能自主探索、发现未知缺陷,手工测试正被“绕过”而非简单替代。文章剖析AI探索性测试的三层架构、真实效能对比,并指出测试人的新定位——从执行者转向策略设计者与AI教练。核心能力不再是“点点点”,而是定义风险、校准AI、沉淀测试知识。
|
1月前
|
Kubernetes 并行计算 算法框架/工具
|
1月前
|
云安全 人工智能 安全
阿里云 Agentic SOC 位居 IDC MarketScape安全运营智能体2026领导者类别
以 Agentic AI 重构安全运营闭环,阿里云云安全在产品能力与市场份额
1357 3
|
1月前
|
运维 数据可视化 物联网
从大模型回答反推内容建设:企业如何用通义千问开展 GEO 诊断
随着用户转向大模型(如通义千问)获取企业软件选型信息,传统SEO已难覆盖决策链。GEO(生成式引擎优化)应运而生——它不追求高频提及品牌,而是聚焦提升公开信息的清晰度、完整性与可信度,确保大模型能准确理解企业定位、场景能力和差异化价值。核心在于:夯实基础信息、强化行业关联、构建真实案例、引入第三方验证,并建立“监测—优化—复测”闭环。
|
1月前
|
弹性计算 人工智能 运维
2026年阿里云服务器价格表:轻量、ECS、GPU云服务器最新配置与定价详解
2026年阿里云弹性计算产品体系持续迭代优化,形成轻量应用服务器、ECS云服务器、GPU云服务器三级算力架构,分别对应轻量化个人场景、通用企业业务场景、高性能加速计算场景。三类产品在硬件配置、网络规格、功能权限、计费模式上形成清晰梯度,能够覆盖个人建站、开发测试、企业生产部署、AI训练推理、科学计算等绝大多数云上应用场景,是当前主流的标准化算力资源组合。
170 1
|
1月前
|
人工智能
2.4 万亿参数 Qwen3.8-Max 发布,三平台一键上手实操,阿里云百炼预览版限时 1 折优惠
阿里云千问Qwen3.8-Max正式发布,参数量达2.4T,代码与办公场景表现卓越。现可通过百炼TokenPlan、Qoder、QoderWork三渠道抢先体验Preview版,享白天1折、夜间再享2折优惠,正式版即将开源。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
1005 2
|
1月前
|
安全 Shell 开发工具
Hawa Code Hands 远程开发 coding agent “脑体”分离
Hawa Code 支持“脑体分离”架构:Agent(模型)与工具解耦,工具在安全沙箱中远程执行。提供内置/独立两种 MCP 服务,支持 Bash、Read、Edit、Grep 等十余种标准化远程开发工具,专注高效、安全的远程代码协作。(239字)
113 3
Hawa  Code  Hands 远程开发 coding agent “脑体”分离
|
2月前
|
前端开发 BI 数据处理
财通证券 x Quick BI:传统业务数字化升级,沉淀300+营销目标场景
财通证券携手瓴羊构建数据中台,打通多系统“数据孤岛”,打造300+市场标签,依托Quick BI实现零代码分析与智能营销,推动APP用户占比从15%跃升至50%,实现数据驱动的精细化运营与组织升级。
|
1月前
|
存储 人工智能 运维
AI 直播软件账号承载能力解析:一套程序最多能管控多少直播号
仅开展分时段轮换直播,单套 AI 直播软件后台可录入数十个直播账号,无硬性数量封顶; 若需要多账号同一时间同步开播,单机买断版本仅支持 1 路同步账号,商用订阅