用AI追热点,自动化编辑新闻,路透社已经这么做了 | 附论文

简介:
本文来自AI新媒体量子位(QbitAI)

8774a9269458187208e9089f5a3cc1a9bac31a8a

“互联网的出现和随后的信息爆炸导致记者越来越难以准确、迅速地获取新闻。”路透社的研发团队本周在arXiv的一篇论文的开场白中如此写道。

对于路透社来说,假新闻的出现导致这个问题变得更加尖锐,因为这些假新闻扭曲了人们对事件的感知。

然而,美联社等新闻机构已经开始使用自动化的新闻写作服务。他们会采用标准的模式,例如,在报道财经新闻和体育比赛结果时,直接将数据粘贴到预先编写的模板中:“X公司第三季度实现利润Y万美元,超出华尔街预期……”

因此,其他新闻机构也面临压力,必须启用自动化新闻制作技术。今天,路透社阐述了它是如何在时间发生后第一时间完全通过自动化技术识别突发新闻的。

刘小沫(XIaomo Liu,音译)他的在路透社研发部门及阿里巴巴的同事表示,这套新系统运行良好。事实上,它有可能彻底改变新闻行业。但这也引发了人们的担忧,他们担心这样一套系统可能被心怀恶意的人控制。

这个新系统被称为路透社追踪器(Reuters Tracer)。它使用Twitter作为一种全球传感器,记录新闻事件的发生。系统之后使用各种类型的数据挖掘和机器学习来挑选出最相关的事件,确定它们的主题,排列它们的优先级,写出标题和摘要。之后,这些新闻就会发布在该公司的全球新闻专线上。

流程的第一步是吸收Twitter的数据流。追踪器每天查看大约1200万条推文,占总数的2%。其中一半是随机抽样,另外一半来自路透社记者的Twitter帐号列表,包括其他新闻机构的帐号、重要的公司、有影响力的个人等。

下一步是确定新闻事件发生的时间。追踪器这样做的前提假设是:如果几个人同时开始谈论这件事,这个事件就已经发生。因此它使用聚类算法来寻找这些对话。

当然,这些聚类包括垃圾信息、广告、普通聊天等。只有一部分涉及有新闻价值的事件。所以下一个步是对事件进行分类和排序。追踪器使用许多算法来完成这项工作。

第一个算法负责确定对话主题。之后将此与路透社团队从31个官方新闻帐号收集的推文进行对比,包括@CNN、@BBCBreaking和@nytimes,以及@BreakingNews等新闻聚合器。

在这个阶段,这套算法还会使用一个包含城市和地理位置的关键词数据库来判断事件发生的地点。

一旦一段谈话或谣言被认为可能是新闻,关键就是要确认它的真实性。为了确定这一点,追踪器需要找出对话中提到的最早的推文和它所指向的网站,以此来寻找来源。然后,它会查询了一个数据库,其中列出了已知的虚假新闻制作者,如《National Report》,或者讽刺新闻网站《The Onion》

最后,该系统会写出标题和摘要,并在整个路透社中分发新闻。

路透社的团队表示,在试验过程中,该系统运行良好。他们说:“追踪器能够在新闻探测和传播上实现有竞争力的准确度和时效性。”

他们有统计数据来支持这一点。该系统每天处理1200万条推文,大约80%的都是噪音。剩下的大约会归入6000个聚类,系统将其视作不同类型的新闻事件。这都是由13个运行10个不同算法的服务器完成的。

相比之下,路透社在世界各地雇佣了大约2500名新闻记者,他们每天都使用包括Twitter在内的各种来源制作大约3000条新闻提示。其中大约有250条是新闻故事。

路透社将追踪器识别的新闻与BBC和CNN等机构新闻的信息流中出现的新闻进行对比。刘小沫和他的同事说:“结果显示,追踪器可以用2%的Twitter数据覆盖70%的新闻报道。”

这套系统的运行速度很快。该团队举了一个例子:2017年10月,拉斯维加斯枪击案导致58人死亡。有目击者在凌晨1点22分报告了这一事件,触发了一个追踪器聚类。

然而,这个聚类不符合系统给事件制定的标准,因而直到凌晨1点39分才被包含到信息流中。“路透社在凌晨1点49分报道了此事。”刘小沫和他的同事说。

这是一项有趣的工作,但也引发了许多问题,特别是关于系统的易用性。不难想象,心怀不轨的人会设计专门的Twitter消息来欺骗追踪器。

不过,这套系统是否比现有的系统更容易欺骗,恐怕还很难判断。毕竟,人类记者也经常被各种假消息欺骗。

此外,人类在新闻行业仍要扮演自己的角色。未来的新闻肯定会越来越自动化,人类如何融入其中仍然无法确定。

论文地址

https://arxiv.org/abs/1711.04068


—  —

本文作者:李杉
原文发布时间:2017-12-03 
相关文章
|
22天前
|
存储 人工智能 算法
AI测试平台实战:深入解析自动化评分和多模型对比评测
在AI技术迅猛发展的今天,测试工程师面临着如何高效评估大模型性能的全新挑战。本文将深入探讨AI测试平台中自动化评分与多模型对比评测的关键技术与实践方法,为测试工程师提供可落地的解决方案。
|
2月前
|
机器学习/深度学习 人工智能 自然语言处理
当AI学会“做实验”:自动化科研的下一个奇点?
当AI学会“做实验”:自动化科研的下一个奇点?
62 0
|
4月前
|
人工智能 自然语言处理 算法
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
279 0
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
|
4月前
|
数据采集 机器学习/深度学习 人工智能
运维人的“福音”?AI 驱动的自动化网络监控到底香不香!
运维人的“福音”?AI 驱动的自动化网络监控到底香不香!
283 0
|
12天前
|
人工智能 运维 安全
运维老哥的救星?AI 驱动的自动化配置管理新趋势
运维老哥的救星?AI 驱动的自动化配置管理新趋势
64 11
|
2月前
|
人工智能 前端开发 测试技术
如何让AI帮你做前端自动化测试?我们这样落地了
本文介绍了一个基于AI的UI自动化测试框架在专有云质量保障中的工程化实践。
925 20
如何让AI帮你做前端自动化测试?我们这样落地了
|
2月前
|
数据采集 人工智能 API
推荐一款Python开源的AI自动化工具:Browser Use
Browser Use 是一款基于 Python 的开源 AI 自动化工具,融合大型语言模型与浏览器自动化技术,支持网页导航、数据抓取、智能决策等操作,适用于测试、爬虫、信息提取等多种场景。
516 4
推荐一款Python开源的AI自动化工具:Browser Use
|
3月前
|
机器学习/深度学习 人工智能 运维
运维不背锅,从“自动修锅”开始:AI自动化运维是怎么回事?
运维不背锅,从“自动修锅”开始:AI自动化运维是怎么回事?
282 49
|
2月前
|
传感器 机器学习/深度学习 人工智能
AI种田有多猛?看它如何“统治”自动化农业!
AI种田有多猛?看它如何“统治”自动化农业!
110 8
|
3月前
|
人工智能 JSON 自然语言处理
Function AI 工作流发布:以 AI 重塑企业流程自动化
本文介绍了基于函数计算 FC 打造的全新 Function AI 工作流服务,该服务结合 AI 技术与流程自动化,实现从传统流程自动化到智能流程自动化的跨越。文章通过内容营销素材生成、内容安全审核和泛企业 VOC 挖掘三个具体场景,展示了 Function AI 工作流的设计、配置及调试过程,并对比了其与传统流程的优势。Function AI 工作流具备可视化、智能性和可扩展性,成为企业智能化转型的重要基础设施,助力企业提升效率、降低成本并增强敏捷响应能力。
510 29

热门文章

最新文章