还只会卷论文吗?70页报告解密顶级大厂如何玩转AI技术(2)

本文涉及的产品
NLP自然语言处理_高级版,每接口累计50万次
NLP 自学习平台,3个模型定制额度 1个月
NLP自然语言处理_基础版,每接口每天50万次
简介: 还只会卷论文吗?70页报告解密顶级大厂如何玩转AI技术
  • 模型优化技术

为了能在各种设备上运行,云信团队对模型进行了大量优化,保证模型处理的高效,同时保持效果稳定。这些优化大量使用了模型剪枝技术来压缩模型参数量,用以减少推理时间。另外,优化还尝试了多种蒸馏方法。

  • 设备优化技术

大量的计算发生在端侧,尤其是移动端,各种设备参差不齐,只靠轻量级的网络不能完全解决问题。云信团队针对移动端自研了自己的深度学习推理框架,自研推理框架大量使用 GPU 进行推理计算,同时对 CPU 进行了大量精细的 SIMD 优化。除了常规的优化外,云信团队还对视频处理的特点做了创新性的优化,使用 int16 量化和稀疏推理。基于上述技术优化,云信团队的深度学习算法在大量移动设备中得以应用,即使在一些较差的设备上也能运行视频超分等算法,有效地提升了用户视频的体验。

  • 网络设计和训练方法优化

在目标检测、识别分割处理两大类任务上,云信团队通过网络设计优化、训练方法优化分别提升了上述任务的效果。在优化网络设计方面,云信团队将流行的 encoder-decoder 网络结构及其变体设计成为主干网络。为了进一步增大感受野,同时更高效地融合各层特征,加入类金字塔结构。除了图像数据外,在 loss 上加入各种特征信息提升学习效果。在训练方法上,云信团队标注了大量数据,同时采用了如下多种方法,包括数据增强扩充样本、随机更换、多尺度训练、难例挖掘等。驾驭AI加持下的客服机器人/自然语言对话技术自然语言对话技术要求系统具备从零学习的能力,快速领悟行业知识,并且针对业务场景进行多轮、有效的对话。在自然语言对话技术的支持下,智能客服机器人提供从文字咨询、智能外呼、业务办理等多维度的客户服务,从客户获取到订单管理实现了无人化、智能化,并越来越多地在金融、零售、房地产、物流等行业应用。自2016年以来,网易云商团队(以下简称「云商团队」)不断完善旗下的智能机器人产品网易七鱼,目前已有40万+企业客户正在使用云商提供的在线客服、云呼叫中心、客服机器人、工单系统等服务。云商团队非常重视对前沿自然语言对话技术的提升:通过优化客服的语义匹配算法和对话框架,云商团队高效解决了复杂场景下的访客需求;通过形成基于行业 know-how 的知识包,成功提高了场景的快速落地能力;通过分布式计算及去 GPU 化,实现了自然语言对话系统的低成本及高可用性。这些技术推动云商智能客服机器人的持续进化,提升客户的满意度。

  • 构建高效解决访客需求、低成本、高可用的技术方案

为了不断优化机器人的应对能力,云商团队着力于提升基于大模型、多模型集成与知识蒸馏的语义匹配算法基于FAISS 语义搜索引擎的智能推荐方案基于知识图谱的问答能力等三个方向。1.基于大模型,多模型集成与知识蒸馏的语义匹配算法云商智能客服机器人的基础功能是识别访客意图。云商团队采用当前主流的 Transformer 结构,同时使用蒸馏加上多模型集成思想,既提升了模型的推理速度,也提高了意图识别的精度。算法采用 sentence-bert 模型思想,并在此基础之上做了重点优化。2.基于 FAISS 语义搜索引擎的智能推荐方案为了方便 B 端客户配置自己的知识库,云商提供智能问法推荐功能。根据客户的问题和语义搜索引擎,系统会提供一系列语义相似但是表述不同的句子供选择,帮助客户快速完成配置工作。云商团队使用的算法是基于 FAISS 的语义搜索引擎。云商团队采用的模型是客服领域的专用模型,同时对向量长度执行 PCA 降维操作,进一步提升检索速度。3.基于知识图谱的问答能力云商还能提供表格知识图谱的功能,精确识别不同的商品型号,以及型号的不同属性。云商团队把销售领域表格分为实体、属性、答案三个部分。通过识别实体和属性,系统能够锁定唯一的一个单元格,把答案反馈到 C 端客户。在这个功能的基础之上,云商的表格知识图谱还支持上下文对话能力,具备反问和推荐的能力。

  • 实现低成本及高可用

作为平台型应用,云商团队不断升级多种技术指标,确保服务业务场景的丰富性和持续反馈。在低成本及高可用的总目标下,云商团队的工作重点是白名单管理平台计算降本增效(去GPU化)模型多版本管理平台以及业务问题定位及效果监控

  • 实现快速冷启动

云商智能机器人的表现基于对行业知识和对话语境的理解,这就要求初始系统具备学习行业知识和极强的变通能力。为了实现快速冷启动,云商团队的技术重点是打造基于行业的知识包构建冷启动助手1.打造行业知识包:云商团队使用 FAISS 语义检索引擎,通过设定不同的阈值条件获得分层聚合的检索结果,并进一步通过DBSCAN完成余下内容的聚类合并。最后通过人工挑选,完成整个行业的知识沉淀。2.构建冷启动助手:云商团队从获得近似问法入手,使用 Paraphrase 生成模型,获得一批相似问法候选项,再通过排序模型,获得最后的相似问法集。另外,云商团队采用了称为回译的方法增加相似问法,该方法借助于翻译模型,将标准问法翻译成英、日、法、德等多国语言,再将翻译结果译回中文,以此获得近似问法。

  • 获得AI能力的持续优化、发挥人机交互的协同优势,提高交互智能度

1.FAQ 知识库的持续构建:云商团队的研究重点是基于人工客服会话的问答提取方案基于说明文档的问答提取方案2.基于人工客服会话的问答提取方案云商团队使用了一种基于客服会话自动构建 FAQ 的方法。首先,利用开源文本相似度语料(如ChineseSTS)训练 Sentence-BERT 模型,将与客户对话的句子向量化。向量化后的文本可利用余弦相似度来衡量文本之间的语义相似度。随后,利用相关规则提取会话中的问句。以语义相似度为权重构建无向连通图,通过改造 PageRank 算法对所有问句进行关键度排序,获取关键问句作为标准问句。最后,将标准问句后面客服的三句答复作为答案候选。通过答复和问句之间的主题相关度进行排序,得到最终答案。


3.基于说明文档的问答提取方案:云商团队还可以根据用户提供的文档提取问答内容,构建云商平台的 FAQ 知识库。云商团队使用一站式的方式,从文档中抽取问答对。这样能够同时提取问题和答案,使问题生成和答案抽取的过程相互影响,有效提升问答对抽取的准确率。问答提取模型采用的是基于 Transformer 的 seq2seq 架构,实践中使用 BART 模型,由双向编码器、自回归解码器构成。· 智能外呼交互体验智能度提升云商团队着手降低算法的不可控性。目前,外呼系统的实现方式采用流程图的形式进行对话状态跟踪(DST)、对话策略(DP)、自然语言生成(NLG)的规则配置。算法主要基于(NLP)技术识别用户意图,通过ASR纠错、噪声过滤、意图识别及实体抽取等环节提取实体信息。

image.png


1.ASR 纠错:ASR 基于端到端框架的流式语音识别系统,支持智能打断功能。ASR 纠错作为 ASR 模块的补充,用于纠正转写过程中出现的错误。纠错过程结合云商机器人的问题,构建出有效的上下文信息,理解用户的内容进行错误识别与纠正。这个补充能够缓解 ASR 转写存在的上下文依赖问题,降低专有名词、近音字的错字率。2.噪声过滤:在ASR纠错后,系统会进行语义检测,通过语义过滤掉无意义和不相关的回复。3.意图识别:系统会通过内置行业知识库和模型,根据用户所属行业领域进行识别。整体上,采取相似度匹配和分类相结合的方式:识别结果依旧优先采用自定义知识的匹配结果,保证用户的特殊配置需求;未匹配到时,依赖领域知识和内置分类模型给出的识别结果。4.实体抽取:提取出用户说话内容中的重要信息,如姓名、地址、时间等,方便后续的数据统计和分析。提取的对象包括内置常用实体和自定义实体两种。常用实体采用 BERT 预训练模型,具有较高的准确率;自定义实体通过配置规则和相似问的方式,具备较高的灵活度。

相关文章
|
7天前
|
机器学习/深度学习 人工智能 自然语言处理
AI技术深度解析:从基础到应用的全面介绍
人工智能(AI)技术的迅猛发展,正在深刻改变着我们的生活和工作方式。从自然语言处理(NLP)到机器学习,从神经网络到大型语言模型(LLM),AI技术的每一次进步都带来了前所未有的机遇和挑战。本文将从背景、历史、业务场景、Python代码示例、流程图以及如何上手等多个方面,对AI技术中的关键组件进行深度解析,为读者呈现一个全面而深入的AI技术世界。
61 10
|
4天前
|
人工智能 安全 算法
深度剖析 打造大模型时代的可信AI:技术创新与安全治理并重
2024年12月11日,由中国计算机学会计算机视觉专委会主办的“打造大模型时代的可信AI”论坛在上海举行。论坛汇聚了来自多家知名学术机构和企业的顶尖专家,围绕AI的技术风险与治理挑战,探讨如何在大模型时代确保AI的安全性和可信度,推动技术创新与安全治理并行。论坛重点关注计算机视觉领域的最新进展,提出了多项技术手段和治理框架,为AI的健康发展提供了有力支持。
30 8
深度剖析 打造大模型时代的可信AI:技术创新与安全治理并重
|
4天前
|
机器学习/深度学习 人工智能 运维
阿里云技术公开课直播预告:基于阿里云 Elasticsearch 构建 AI 搜索和可观测 Chatbot
阿里云技术公开课预告:Elastic和阿里云搜索技术专家将深入解读阿里云Elasticsearch Enterprise版的AI功能及其在实际应用。
阿里云技术公开课直播预告:基于阿里云 Elasticsearch 构建 AI 搜索和可观测 Chatbot
|
4天前
|
机器学习/深度学习 传感器 人工智能
AI视频监控系统在养老院中的技术实现
AI视频监控系统在养老院的应用,结合了计算机视觉、深度学习和传感器融合技术,实现了对老人体征、摔倒和异常行为的实时监控与分析。系统通过高清摄像头和算法模型,能够准确识别老人的动作和健康状况,并及时向护理人员发出警报,提高护理质量和安全性。
34 14
|
5天前
|
传感器 机器学习/深度学习 人工智能
AI视频监控卫士技术介绍:智能化河道管理解决方案
AI视频监控卫士系统,通过高清摄像头、智能传感器和深度学习技术,实现河道、水库、城市水务及生态保护区的全天候、全覆盖智能监控。系统能够自动识别非法行为、水质变化和异常情况,并实时生成警报,提升管理效率和精准度。
37 13
|
3天前
|
存储 人工智能 运维
AI-Native的路要怎么走?一群技术“老炮儿”指明了方向
上世纪70年代,沃兹尼亚克、乔布斯等人成立Homebrew Computer Club,推动个人电脑普及。如今,创原会承袭这一精神,由CNCF执行董事Priyanka Sharma等构建,聚焦云原生和AI技术,汇聚各行业技术骨干,探索前沿科技。2024年创原会年度峰会达成“全面拥抱AI-Native”共识,解决算力与存储瓶颈,推动AI原生应用开发,助力千行万业智能化转型,成为行业创新风向标。
|
5天前
|
人工智能 计算机视觉
幻觉不一定有害,新框架用AI的幻觉优化图像分割技术
在图像分割领域,传统方法依赖大量手动标注数据,效率低下且难以适应复杂场景。为解决这一问题,研究人员提出了“任务通用可提示分割”方法,利用多模态大型语言模型(MLLM)生成实例特定提示。然而,MLLM常出现幻觉,影响分割精度。为此,研究团队开发了“Prompt-Mask Cycle”(ProMaC)框架,通过迭代生成和验证提示及掩码,有效利用幻觉信息,提高了分割精度和效率。实验结果表明,ProMaC在多个基准数据集上表现出色,为图像分割技术的发展提供了新思路。
18 6
|
12天前
|
机器学习/深度学习 人工智能 自然语言处理
转载:【AI系统】AI的领域、场景与行业应用
本文概述了AI的历史、现状及发展趋势,探讨了AI在计算机视觉、自然语言处理、语音识别等领域的应用,以及在金融、医疗、教育、互联网等行业中的实践案例。随着技术进步,AI模型正从单一走向多样化,从小规模到大规模分布式训练,企业级AI系统设计面临更多挑战,同时也带来了新的研究与工程实践机遇。文中强调了AI基础设施的重要性,并鼓励读者深入了解AI系统的设计原则与研究方法,共同推动AI技术的发展。
转载:【AI系统】AI的领域、场景与行业应用
|
7天前
|
机器学习/深度学习 人工智能 算法
探索AI在医疗诊断中的应用与挑战
【10月更文挑战第21天】 本文深入探讨了人工智能(AI)技术在医疗诊断领域的应用现状与面临的挑战,旨在为读者提供一个全面的视角,了解AI如何改变传统医疗模式,以及这一变革过程中所伴随的技术、伦理和法律问题。通过分析AI技术的优势和局限性,本文旨在促进对AI在医疗领域应用的更深层次理解和讨论。