基于外卖评论的舆情风控

简介: 目前许多商家都有线上留言或者评论反馈平台,消费者可以在这些平台上通过留言表达自己对于消费商品的反馈。消费者的反馈包括表扬性的正向反馈,也有一些批评性质的负向反馈。商家需要掌握消费者对于产品的整体舆论取向来判断自己的产品质量是否符合消费者需求,同时了解评论内容可以方便商家分析舆论导向,指导下一步产品研发工作。

业务背景

目前许多商家都有线上留言或者评论反馈平台,消费者可以在这些平台上通过留言表达自己对于消费商品的反馈。消费者的反馈包括表扬性的正向反馈,也有一些批评性质的负向反馈。商家需要掌握消费者对于产品的整体舆论取向来判断自己的产品质量是否符合消费者需求,同时了解评论内容可以方便商家分析舆论导向,指导下一步产品研发工作。

业务痛点

目前许多酒店、餐饮、零售的留言平台每天都有大量的留言产生,传统的舆论情绪收集方案是通过人工统计的方式,但是这种方式较为低效,很难针对大规模的舆论做出精确统计。需要自动化的手段收集并判断留言平台的舆论走向。

解决方案

PAI平台提供了一套基于文本向量化以及分类的算法,可以基于历史标记的正负留言内容生成分类模型,自动对平台上的新增留言进行预测。该服务的整体框架已经基于PAI-Studio开发完成,基于真实的打标后的11987条外卖平台评论数据,实现了自动化的正反面舆论风控,准确性达到75%左右。

1.人力要求:需要具备基础的NLP及分类算法知识用于模型调试

2.开发周期:1-2天

3.数据要求:最好有超过千条的打标数据,数据越多效果越好

数据说明

参数名称 参数描述
label 标签,1是正向评论,0为负面评论
review 实际评论数据

流程说明

进入PAI-Studio产品:https://pai.data.aliyun.com/console

该方案数据和实验环境已经内置于首页模板:

打开实验:

1.数据源

上文提到的评论数据

2.停用词

过滤一些助动词以及标点符号,需要自己上传停用词表

3.文本向量化

利用Doc2vector算法把每个评论变成语意向量,每行是一个向量,每个向量代表一个评论的含义

4.生成分类模型

将向量化后的文本通过拆分算法拆分为训练集以及测试集,训练集通过逻辑回归算法训练生成二分类模型,该模型可以实现对于评论是正向评论或者负向评论的判断。

5.模型效果验证

通过混淆矩阵算法验证模型的实际效果,

总结

本文提到的基于留言评论的舆情风控方案可以用PAI组件在1-2天时间内非常快速的实现,实现后可以批量的对于平台上面的留言舆论进行智能化分析,并且随着数据的累计,模型的准确性会逐渐增强。该方案适用用各种基于文本场景的分析,比如垃圾邮件分类、新闻正反情绪分类等。

相关实践学习
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
目录
相关文章
|
算法
推荐召回场景-FM Embedding实现方案
智能推荐分为排序和召回两大模块,在召回模块中通常会采用将 用户User和待推荐的 内容Item 分别以向量表示,然后通过User和Item的向量乘积大小作为User对Item的感兴趣程度的判断。本案例介绍如何基于真实的推荐场景数据,通过使用PAI平台提供的FM算法和Embedding提取算法产生User和Item的描述向量。
5358 110
推荐召回场景-FM Embedding实现方案
|
SQL 机器学习/深度学习 监控
用户流失预警风控
在业务发展过程中有两个重要的环节,一个是拉新,另一个是留存。如何做到用户的留存需要很多技术手段保证,一个比较重要的方式是建立用户流失模型,通过学习历史上流失用户的特点,通过机器学习的手段训练处风控模型,队可能会流式的用户进行预测,然后可以提前通过运营手段做一些用户流失的防范。
4343 109
用户流失预警风控
|
算法 搜索推荐 数据处理
基于消费信用评估的风控
信用评估是被当前社会广泛关注的领域,特别是在金融行业,如果可以通过每个用户的历史交易数据以及用户画像数据确定用户的个人信用,将有助于银行设置个人借贷额度,确定潜在风险。本文将介绍在金融风控领域如何进行用户画像,使用什么样的算法可以计算出每个用户的信用指标。
2204 110
基于消费信用评估的风控
|
机器学习/深度学习 SQL 运维
异常行为监控
用户系统中如果出现任何的异常数据,比如一个运维系统的CPU消耗突然增高,比如平台突然有大量不良信息产生,比如有用户大量薅羊毛,这些行为都是平台的异常指标。如果能通过机器学习的方式帮助用户针对各种异常指标做预防和实时预警,将大大建设平台方的风险。
4316 110
异常行为监控
|
弹性计算 分布式计算 MaxCompute
华北1 ECS 数据如何免费且高速同步到华北2MaxCompute
用户业务早期开在了华北1青岛,想搭数据仓库,但华北1又没有MaxCompute,怎么办?如果华北1 ECS跨Region数据同步到华北2MaxCompute,是否产生额外的带宽费用和同步性能差? 今天小编亲自测试下华北1 ECS 通过经典网络数据同步到华北2MaxCompute,打消大家对费用和性能的担心。
2825 110
华北1 ECS 数据如何免费且高速同步到华北2MaxCompute
|
机器学习/深度学习 算法框架/工具 网络可视化
PAI实现的深度学习网络可视化编辑功能-FastNeuralNetwork
在深度学习领域流传着这样一句话,“一张好的表示图,胜过一千个公式” 本文会介绍如何通过PAI-DSW中的FastNerualNetwork功能实现深度学习网络的可视化编辑。 神经网络最早诞生于生物领域,用来模仿生物大脑复杂的神经元构成,后来人类为了探索大脑是如何思考,通过一层一层的数学公式来模拟大脑分析事物的过程。
8096 110
|
分布式计算 DataWorks Java
[MaxCompute MapReduce实践]通过简单瘦身,解决Dataworks 10M文件限制问题
用户在DataWorks上执行MapReduce作业的时候,文件大于10M的JAR和资源文件不能上传到Dataworks,导致无法使用调度去定期执行MapReduce作业。 解决方案: jar -resources test_mr.
3845 110
|
分布式计算 大数据 MaxCompute
中国唯一,阿里云进入Forrester大数据服务榜单
日前,全球权威调研机构Forrester发布《2018年一季度云端数据仓库》报告。报告对大数据服务商的主要功能、区域表现、细分市场和典型客户等进行了全面评估,最终AWS、阿里云、Google、微软四大巨头杀入全球一线阵营。
6562 110
|
存储 分布式计算 算法

热门文章

最新文章