跨国巨头猛攻语音识别技术 让电脑听懂人们说话

简介:
其实,自电脑诞生以来,让电脑听懂人们的说话,就是科学家们奋斗的目标.几年前,这方面还仅局限于实验室内的演示.不过现在不同了,电脑的语音识别功能已经有了质的飞跃,并被广泛运用到各个领域.

语音识别已经不再遥不可及!
近日,微软新推出的Windows Vista就安装了语音识别系统。不懂鼠标和键盘操作的人,有了此软件的帮助,问题就能迎刃而解。这也是这一操作系统的一大亮点。
从上世纪50年代开始,语音识别作为重要的研究对象,引起了科学家的广泛兴趣。今天,半个多世纪过去了,语音识别技术已经发生了突飞猛进的变化,IBM、苹果和微软等公司甚至已经把它应用于自己的部分产品中。
目前,语音识别软件主要运用于法律和医药领域,但随着软件的日趋完善,将被更多领域采纳和运用,并帮助人们解决疑难问题。
不过,语音识别软件目前或多或少存在缺陷,如抗干扰差、语音识别误差较大、易受黑客攻击等。因此,要想短期内取代手工操作还不现实。
备受青睐
其实,自电脑诞生以来,让电脑听懂人们的说话,就是科学家们奋斗的目标。几年前,这方面还仅局限于实验室内的演示。不过现在不同了,电脑的语音识别功能已经有了质的飞跃,并被广泛运用到各个领域。
微软和福特汽车正在进行一项有趣的工作,他们希望人们能向汽车发出口头指令,这让人觉得有些不可思议。不过,人们通过芯片进行口头交流,早已成为现实,只是目前还没有被广泛应用到日常生活中,所以大家对此感到陌生。可以肯定的是,随着技术的日趋成熟,今后人们和芯片的交流的机会将越来越多。
前不久,在拉斯维加斯举行的国际电子消费品展览会上,比尔·盖茨和福特汽车的高管们,展示了微软的Sync软件,它可让驾车者们如何通过口头指令,在车内播放音乐和拨打电话。但是,通过口头指令驾驶汽车还难以被广泛运用,至少目前还不行。
IBM在语音识别技术上,一直走在最前沿。以它的ViaVoice软件为例,这种软件可以帮助人们通过麦克风用语音向字处理软件输入文字,能识别英语、意大利语、德语、法语、日语、汉语等语种。由于大量的无线上网设备的使用,语音识别软件的销售前景看好,特别适用于医生、律师和作家等职业。
从去年9月1日开始,该语音识别软件已经开始降价销售,其中最便宜的一款只需30美元。据估计,目前,全世界已有1000多万人在使用ViaVoice软件。
微软新版的Windows操作系统Vista,也配置了先进的语音识别软件。用户可以通过语音和计算机交流——对于无法操作键盘和鼠标设备的人们,这是一个很重要的功能。经过训练,Vista能识别用户的语音。这样,用户就可以通过口述来“书写”信件或电子邮件。一言以敝之,用户可以通过语音来执行大多数常见任务。
不过,目前世界上最先进的语音识别软件,既不是微软生产的,也非IBM制造,它的名字叫做Naturally Speaking,出自于Nuance Communications公司。
Naturally Speaking已经得到了大多数用户的认可。用户对着麦克风说话,屏幕上就显示出说话的内容,很容易识别和纠正错误。久而久之,该软件就会适应用户的说话风格,当然,用户如果在说话过程中发现软件无法识别的,也相应地作出调整,这样一来,语音识别的正确率就会逐渐提高。
用途广泛
在语音识别软件领域,比尔·迈森很有发言权,他是这方面的专家。他指出:“目前该软件主要用于法律和医学等特定领域。例如,放射线学者们越来越多地通过语音识别软件口授诊断报告和结果,而不再由录音机录下口头报告,再加以转录。”
语音识别软件是利用非常复杂的统计方法,把人们的讲话与单词相对应起来的。如今,语音识别技术在一些领域已经得到广泛应用,如呼叫中心。采用这项技术,可以省去不少麻烦,目前已有不少电脑查询服务采用了Nuance公司的技术,来处理客户的需求。
可以看出,语音识别技术的特点就是使工作变得自动化。但也有人指出,语音识别技术发展到足够强大并得到普遍应用的时候,在给人类带来方便的时候,同时也会使更多的人失去工作。比如,现在很多公司都设置咨询室,将来有可能被机器取代,人们可以通过公司的电脑发出口头指令来完成各项咨询。
迈森预言:“接下来,语音识别技术将被用于网络搜索。”不久的将来, Google和雅虎将推出面向手机用户的语音搜索服务,用户只要说出自己要找什么,就可以听到电脑的自动答复。这2家公司都已聘请了语音识别技术专家。 Nuance还与雅虎对簿公堂,因为雅虎挖走了Nuance的13名工程师。
IBM也不甘步人后尘,此前它在语音识别一直处在领先位置。目前,IBM正在实施一个超前的计划——研制一种能监听4-5个人参加的小型会议的语音识别软件,用以提供准确的书面记录。这一步迈得很大,不知道何时能取得成功。
此外,负责IBM的语音识别技术开发的戴维·那哈莫还表示,该公司已经开发出了其他一些应用软件。其中一项能自动翻译外语广播——该软件首先通过语音识别技术记录下说话者所说的话,然后通过翻译软件把外语翻译成英语。
尽管这一软件目前还不成熟,不过它已经能够翻译出说话者的要点。这一软件的卖点不错,尤其受缺乏外语人才的机构和部门欢迎,比如情报机构。当然,该软件也适合缺乏人手的电视台,为听觉有障碍的观众提供字幕服务。
正视缺陷
当然,语音识别软件还没有发展到能够取代键盘和鼠标的程度,还有很多不完善的地方,这也是所有语音识别软件目前普遍存在的问题。比如抗干扰,这类软件还无法分辨出哪是人的发音,哪是音响的发音。
在语音识别上,目前也存在差错。在一家公司的一次演示中,与会者大跌眼镜。这家公司的工作人员试图让自己开发的软件识别“Dear Mom”这个短语的发音,然而,让人哭笑不得的是,语音识别软件却把它理解为“Dear aunt”,也就是著名的“认母为姨”。
此外,语音识别还可能被黑客利用,不久前就传出Vista的语音功能存在缺陷,容易遭致黑客利用进行远程语音攻击。微软对此表示,安全人员此前公布了该漏洞,影响微乎其微。
微软安全响应中心的发言人宣称,攻击者利用此漏洞仅能获得当前用户的权限,并不能绕过用户帐户控制系统的监管运行任何管理员级别的命令。黑客要想成功发动攻击,前提条件是目标系统已经设置好语音识别功能,并且启用话筒和音箱,此时他们可以通过音频文件的播放执行复制、删除、关机等命令。因此微软方面建议不要一直同时开启麦克风和音箱。如发现有执行命令的音频文件播放,要关闭媒体播放器和语音识别,重启电脑。
安全响应中心的程序经理Adrian Stone称:“我们对该问题十分重视,经过调查,我可以自信地说,没有必要担心该问题。”
苹果公司在语音识别上也曾经存在漏洞,不过,发现后他们很快修复了漏洞。

消息原载《IT时代周刊》
















本文转自starger51CTO博客,原文链接:http://blog.51cto.com/starger/20030 ,如需转载请自行联系原作者


相关实践学习
达摩院智能语音交互 - 声纹识别技术
声纹识别是基于每个发音人的发音器官构造不同,识别当前发音人的身份。按照任务具体分为两种: 声纹辨认:从说话人集合中判别出测试语音所属的说话人,为多选一的问题 声纹确认:判断测试语音是否由目标说话人所说,是二选一的问题(是或者不是) 按照应用具体分为两种: 文本相关:要求使用者重复指定的话语,通常包含与训练信息相同的文本(精度较高,适合当前应用模式) 文本无关:对使用者发音内容和语言没有要求,受信道环境影响比较大,精度不高 本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。 讲师介绍: 郑斯奇,达摩院算法专家,毕业于美国哈佛大学,研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。
目录
打赏
0
0
0
0
143
分享
相关文章
基于深度学习的语音识别技术应用与发展
在当今数字化时代,语音识别技术已经成为人机交互领域的重要组成部分。本文将介绍基于深度学习的语音识别技术在智能助手、智能家居和医疗健康等领域的应用与发展,同时探讨该技术在未来的潜在应用和发展方向。
246 4
未来语音交互新纪元:FunAudioLLM技术揭秘与深度评测
人类自古以来便致力于研究自身并尝试模仿,早在2000多年前的《列子·汤问》中,便记载了巧匠们创造出能言善舞的类人机器人的传说。
12497 116
医疗行业的语音识别技术解析:AI多模态能力平台的应用与架构
AI多模态能力平台通过语音识别技术,实现实时转录医患对话,自动生成结构化数据,提高医疗效率。平台具备强大的环境降噪、语音分离及自然语言处理能力,支持与医院系统无缝集成,广泛应用于门诊记录、多学科会诊和急诊场景,显著提升工作效率和数据准确性。
智能语音交互技术:构建未来人机沟通新桥梁####
【10月更文挑战第28天】 本文深入探讨了智能语音交互技术的发展历程、当前主要技术框架、核心算法原理及其在多个领域的应用实例,旨在为读者提供一个关于该技术全面而深入的理解。通过分析其面临的挑战与未来发展趋势,本文还展望了智能语音交互技术如何继续推动人机交互方式的革新,以及它在未来社会中的潜在影响。 ####
207 0
智能语音交互技术的突破与未来展望###
【10月更文挑战第27天】 本文聚焦于智能语音交互技术的最新进展,探讨了其从早期简单命令识别到如今复杂语境理解与多轮对话能力的跨越式发展。通过深入分析当前技术瓶颈、创新解决方案及未来趋势,本文旨在为读者描绘一幅智能语音技术引领人机交互新纪元的蓝图。 ###
140 0
FunAudioLLM技术深度测评:重塑语音交互的未来
在人工智能的浪潮中,语音技术作为人机交互的重要桥梁,正以前所未有的速度发展。近期,FunAudioLLM以其独特的魅力吸引了业界的广泛关注。本文将以SenseVoice大模型为例,深入探索FunAudioLLM在性能、功能及技术先进性方面的表现,并与国际知名语音大模型进行对比分析,同时邀请各位开发者共同参与,为开源项目贡献一份力量。
108 4
使用深度学习进行语音识别:技术探索与实践
【8月更文挑战第12天】深度学习技术的快速发展为语音识别领域带来了革命性的变化。通过不断优化模型架构和算法,我们可以期待更加准确、高效和智能的语音识别系统的出现。未来,随着技术的不断进步和应用场景的不断拓展,语音识别技术将在更多领域发挥重要作用,为人类带来更加便捷和智能的生活体验。
PHP对接百度语音识别技术
PHP对接百度语音识别技术
115 1
语音识别和语音合成技术
语音识别和语音生成是人工智能的重要分支,旨在实现计算机对人类语音的理解和生成。随着深度学习技术的快速发展,语音识别和生成技术在近年来取得了显著进展,并在多个领域实现了广泛应用。本文将介绍语音识别和生成的基本原理、关键技术及其应用,并探讨其未来的发展趋势。
277 3
尖叫!FunAudioLLM 技术掀起狂潮,开启语音交互的惊天巨变之门!
【8月更文挑战第8天】随着科技的进步,语音交互已成为日常不可或缺的部分。FunAudioLLM凭借其先进的自然语言处理和深度学习技术,在语音理解和生成方面实现了突破。相较于传统技术,它提升了理解和响应速度。通过简单的Python代码示例,我们可以测试其对如天气查询等指令的快速准确反馈。FunAudioLLM不仅适用于日常交流,还在医疗、教育等领域展现出应用潜力。尽管存在多语言环境下的准确性挑战,其为语音交互领域带来的革新仍值得期待。随着技术的持续发展,FunAudioLLM将为更多领域带来便利和效率。
83 0

热门文章

最新文章

AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等