玩笑到现实,大数据涉足文学研究--用数据模型分析莎翁著作

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 自然语言研究一直以来都是计算机研究的一个重要方向。随着大数据时代的到来,人们也越来越关注自然语言这方面的进展。而文学是自然语言这个皇冠上的明珠。人们都拭目以待大数据摘下这颗明珠的那一天。

几十年来,文学作品中的统计分析已经从单纯的破译理论发展到尖端研究

abde22bef8b8d60ca9d6f45be45ed815741e0440

1993年,Tom Stoppard的戏剧《世外桃源》(Arcadia正式上演在这部脑洞大开的戏剧中那些用数据统计进行文学评论的桥段成为圈内人的笑料。剧中位傻乎乎的诗歌教师,Bernard Nightingale嘲笑他的同事用计算机程序来断定一个没有署名的故事出自于劳伦斯(D.H. Lawrence)之手并且还得意的指出“在同样的统计基础上,竟然有百分之九十的可能性,Lawrence还撰写了《淘气小威廉》(“Just William”.作者是里奇马尔Richmal Crompton)这本书以及前一天的《百眼巨人报(英国布莱顿市的一份地方报纸)虽然这只是该剧中的几个笑话,但现在突然变得令人“细思恐极”了 随着《新牛津莎士比亚》系列的出版,人们开始了一场关于伊丽莎白时期剧作家身份的讨论


新牛津莎士比亚全集的最新版登上了去年10月份的头条新闻。因为书中指出莎士比亚的44部戏剧作品有17部是和别人共同完成的(相比之下,1986仅列出了8)。 而其中一个出现的人名,马洛(Christopher Marlowe),更让人们兴奋不已这个名字的出现似乎佐证了之前一些关于作者身份被驳回的阴谋论 然而,更吸引人眼球的是得出这个论断背后的技术。人们已不再是根据编辑观察等传统的方式,而是通过计算分析来做出这样的结论。 那么今天的数据语言学家是如何在不受作者影响力的前提下,弄清楚作者与作品的关系的呢 同时我们更需要思考为什么做到这点很重要


计算机和人类可以通过一些“附加词”来识别是不是莎士比亚的作品,如他会经常在自己的作品中使用 “gentle”, “answer”, “beseech”, “tonight” 显然这种方法来判断是不是莎翁作品已经变得不那么准确了,因为那时候的作家常常会模仿其他人的行文风格 早期的剧作家是非常紧密的一个团体,而与此同时16世纪的观众似乎并不是很在意作品的独创性《帖木儿》(Tamburlaine),马洛的一部非常受欢迎的戏剧,当时被许多人模仿衍生出各种续作。以至于当时著名的剧作家本·琼森(Ben Jonson)对该剧被无休止的模仿而发出了哀叹。 莎士比亚也和其他人一样没能免俗。 《马耳他岛的犹太人》(“The Jew of Malta” ,1589)中, 马洛笔下的巴拉巴斯将他的女儿阿比盖尔隔离在一个阳台上:

“But stay! What star shines yonder in the east?

The lodestar of my life, if Abigail!”

(“看! 哪颗星星在东方发光?就是我生命中北极星,阿比盖尔!“)


如果这段台词听起来很熟悉那是因为十年后莎士比亚笔下的罗密欧有着类似的台词

“But soft! What light through yonder window breaks?

It is the East, and Juliet is the sun!” (“轻声!那边窗子里亮起来的是什么光?这是东方,而朱丽叶就是太阳!“)


在这种相互影响的情况下,电脑如何能够分辨出马洛和莎士比亚本人的作品以及他们作品中相互借鉴的区别?根据《新牛津莎士比亚》的编辑,其中的关键在于“功能词”, 就是 to”或“a”这类能够为句子提供语法支撑的单词。 他们的理论认为作家们都会无意识地以自己独特的方式使用这些词。 例如,莎士比亚经常把“and”与 with”连在一起用 - 克劳狄斯与乔特鲁德婚礼中的“With mirth in funeral and with dirge in marriage” (“葬礼中的挽歌和婚礼中有欢歌”),老哈姆雷特的鬼魂说到“缓慢而庄严得出现在他们面前”( “Appears before them, and with solemn march。Goes slow and stately”) 因此即使作家们试图模仿他人的写作风格,功能词的使用仍然能够揭示他们真实的身份。 通过分析作家如何使用那些功能词,计算机可以初步地识别他们独特的语言指纹。


在莎士比亚作品的研究中,能够获知作品作者,作品内容以及写作时间是非常关键的,通过这些信息能有助于说服那些唯莎士比亚论者,因为在他们眼里莎翁就是一个孤傲的天才。 之前之所以人们会认为莎士比亚少有与人合作,主要原因还是那些与他合作的作家并不是非常出色。尽管计算机模型不是绝对准确的,但是以证据而非作品质量来判定作品的归属还是令人信服的。


其次,正确的作品归属让我们更好的了解戏剧作品本身。 当我们打开一部历史戏剧作品的第一页,就像开始了一部关于这段历史的电影。 由于《亨利六世》第二章的大部分可能是马洛撰写的,这就打破了这个历史剧作的统一性。 马洛更多的表现出对普通百姓角色(比如低调的杰克·凯德)的兴趣,而不是那些无所不能的君主;相反, 莎士比亚更喜欢“国王之死”类似的故事。 知道同一部作品出自他们两人之手,了解到其中的争议和共生,我们可以更好地理解戏剧本身。


据《新牛津莎士比亚》编辑之一加布里埃尔·埃根(Gabriel Egan)所说,归因模型越来越准确,主要的原因就是“计算机研究人员越来越多地将研究精力转向自然语言,而自然语言研究是计算机发展方向中最难的问题之一 。“在《世外桃源》中,Bernard Nightingale曾坚持认为”你不能把拜伦的思想放进笔记本电脑里“。但就现在的情况来看,他的观点仍然可能是正确的。 在控制测试中,即使像《新牛津莎士比亚》所使用的高级模式,有时也会有明显的误判,把作品张冠李戴。统计分析仍将是重要的分析工具之一。因为它有着学术的客观性,只是之前人们在莎士比亚研究领域很少用到。


以上为译文

本文由北邮@爱可可-爱生活 老师推荐,阿里云云栖社区组织翻译。

文章原标题《Revenge of the maths mob - Why literature is the ultimate big-data challenge》,由《经济学人》发布。

译者:friday012 ;审校:主题曲(身行)

文章为简译,更为详细的内容,请查看原文原文文本也可见附件

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
16天前
|
存储 机器学习/深度学习 SQL
大数据处理与分析技术
大数据处理与分析技术
57 2
|
5天前
|
机器学习/深度学习 存储 大数据
在大数据时代,高维数据处理成为难题,主成分分析(PCA)作为一种有效的数据降维技术,通过线性变换将数据投影到新的坐标系
在大数据时代,高维数据处理成为难题,主成分分析(PCA)作为一种有效的数据降维技术,通过线性变换将数据投影到新的坐标系,保留最大方差信息,实现数据压缩、去噪及可视化。本文详解PCA原理、步骤及其Python实现,探讨其在图像压缩、特征提取等领域的应用,并指出使用时的注意事项,旨在帮助读者掌握这一强大工具。
19 4
|
7天前
|
机器学习/深度学习 分布式计算 算法
【大数据分析&机器学习】分布式机器学习
本文主要介绍分布式机器学习基础知识,并介绍主流的分布式机器学习框架,结合实例介绍一些机器学习算法。
54 5
|
18天前
|
存储 监控 数据挖掘
【Clikhouse 探秘】ClickHouse 物化视图:加速大数据分析的新利器
ClickHouse 的物化视图是一种特殊表,通过预先计算并存储查询结果,显著提高查询性能,减少资源消耗,适用于实时报表、日志分析、用户行为分析、金融数据分析和物联网数据分析等场景。物化视图的创建、数据插入、更新和一致性保证通过事务机制实现。
76 14
|
24天前
|
消息中间件 分布式计算 大数据
数据为王:大数据处理与分析技术在企业决策中的力量
【10月更文挑战第29天】在信息爆炸的时代,大数据处理与分析技术为企业提供了前所未有的洞察力和决策支持。本文探讨了大数据技术在企业决策中的重要性和实际应用,包括数据的力量、实时分析、数据驱动的决策以及数据安全与隐私保护。通过这些技术,企业能够从海量数据中提取有价值的信息,预测市场趋势,优化业务流程,从而在竞争中占据优势。
70 2
|
25天前
|
数据采集 机器学习/深度学习 搜索推荐
大数据与社交媒体:用户行为分析
【10月更文挑战第31天】在数字化时代,社交媒体成为人们生活的重要部分,大数据技术的发展使其用户行为分析成为企业理解用户需求、优化产品设计和提升用户体验的关键手段。本文探讨了大数据在社交媒体用户行为分析中的应用,包括用户画像构建、情感分析、行为路径分析和社交网络分析,以及面临的挑战与机遇。
|
25天前
|
机器学习/深度学习 搜索推荐 大数据
大数据与教育:学生表现分析的工具
【10月更文挑战第31天】在数字化时代,大数据成为改善教育质量的重要工具。本文探讨了大数据在学生表现分析中的应用,介绍学习管理系统、智能评估系统、情感分析技术和学习路径优化等工具,帮助教育者更好地理解学生需求,制定个性化教学策略,提升教学效果。尽管面临数据隐私等挑战,大数据仍为教育创新带来巨大机遇。
|
2月前
|
存储 机器学习/深度学习 分布式计算
大数据技术——解锁数据的力量,引领未来趋势
【10月更文挑战第5天】大数据技术——解锁数据的力量,引领未来趋势
|
14天前
|
存储 分布式计算 数据挖掘
数据架构 ODPS 是什么?
数据架构 ODPS 是什么?
110 7
|
14天前
|
存储 分布式计算 大数据
大数据 优化数据读取
【11月更文挑战第4天】
30 2