范文健康探索娱乐情感热点
热点动态
科技财经
情感日志
励志美文
娱乐时尚
游戏搞笑
探索旅游
历史星座
健康养生
美丽育儿
范文作文
教案论文

未来自动翻译软件将如何突破多语种翻译障碍

  北京时间 3 月 31 日消息,全球有 7000 多种语言,但其中 4000 多种仅能书写,无法进行听说交流,像谷歌翻译这样的自动翻译软件也仅能翻译 100 种语言,目前,科学家最新研究称,未来我们能使用自动翻译软件实现更多语言的交流沟通 。
  设想一下,当你收到一条可能包含救命的信息,但你一个字也看不懂,你甚至不确定这条信息是用哪种语言书写的,此时你怎么办?
  如果该条信息是法语或者西班牙语,把它输入到自动翻译软件中会就立即解开谜团,并给出一个准确的英语版翻译答案,然而,全球许多语言仍无法进行机器翻译,包括数百万人使用的语言,例如:非洲的沃洛夫语、卢干达语、契维语和埃维语。这是因为支持这些翻译软件的算法是基于人类翻译文本,理想情况下,该语言的翻译文本需要达到数百万字。
  ▲ 联合国每年产生大量翻译文本,可用于训练翻译算法
  由于加拿大议会、联合国和欧盟等多语言机构的存在,英语、法语、西班牙语和德语等语言有大量的翻译素材,不同国家的译员人工翻译大量笔录和其他文件,仅欧洲议会在过去 10 年里,在 23 种语言中产生了 13.7 亿个单词的翻译数据。
  然而,对于那些使用广泛但翻译内容不丰富的语言,就不存在这样的数据信息库,它们也被称为低资源语言。这些语言的备用机器翻译培训素材包括部分出版物,例如:翻译数次的《圣经》,但这是匮乏的翻译数据,并不能设计准确、广泛应用的自动翻译软件。
  目前,谷歌翻译软件提供了大约 108 种不同语言的交互翻译功能,而微软"必应翻译"提供了大约 70 种语言,然而,世界上有 7000 多种口语,其中至少 4000 种拥有文字系统。
  这种语言障碍对于任何需要快速收集精确全球信息的人而言都是一个难题,甚至包括情报机构,美国情报机构 IARPA 项目主管卡尔・鲁比诺说:"一个人对了解世界越感兴趣,他就越有能力获得非英语的资源数据,现今我们面临诸多挑战,例如:经济、政治不稳定,新冠病毒肆意传播,全球气候变化,探索地外空间等,这些挑战都将面临着多语言环境。"
  培训一名人工译员或者情报分析员学习一门新语言可能需要几年时间,即便如此,它可能也不足以完成当前的任务。鲁比诺说:"例如:在尼日利亚,人们使用的语言超过 500 种,即使是尼日利亚国内最优秀的语言专家,也可能仅懂得其中部分语言。"
  ▲机器翻译工具可以在没有人工翻译的情况下提供重要的交流方式
  为了突破这一障碍,IARPA 投资一项研究,用于开发一种语言系统,能够从任何资源匮乏的语言(无论是文本语言还是语音语言)中寻找、翻译和总结信息。
  人们可以想象一下,一种新型搜索软件,用户在搜索框键入英文,就会收到一个英文摘要文档列表,这些文档都是从某种外语翻译过来的,当他们点击其中一个文档,完整的翻译文件就会生成,虽然该研究经费来自于 IARPA,但研究是由竞争团队公开进行,其中大部分翻译文件现已发布。
  人们学习一门语言,并不是用于阅读几年以来的国际议会记录。
  美国哥伦比亚大学计算机科学家凯瑟琳・麦基翁带领一支研究团队,致力于研究多语种翻译,她发现该领域带来的益处远超出情报侦察,她说:"我们的最终目标是促进来自不同文化的人们产生更多互动交流,以及获得更多关于他们的信息。"
  该研究团队使用神经网络技术来解决这一难题,这是一种模仿人类思维某些方面的人工智能形式,近年来,神经网络模式已经彻底改变了语言处理,他们可以学习单词和句子的含义,而不仅仅是记忆单词和句子,他们结合上下文发现,像英语中的"dog"、"poodle",与法语中的"chien"表达的概念是相似的,即使它们字母构成相差很大。
  然而,要做到这一点,该语言模型通常需要经过数百万页文字翻译训练,其挑战在于让语言模型像人类一样,基于少量数据学习,毕竟人类不需要阅读几年的国际议会记录来学习一门语言。
  美国麻省理工学院计算机科学家蕾贾纳・巴尔齐莱是另一支研究团队的成员,她说:"无论你何时学习一种偏门语言,相信你一生之中都不会看到现今机器翻译系统用于学习英法互译的数据量,你能看到非常少量的一部分语言翻译数据,能概括和理解法语。同样地,你也希望看到新一代机器翻译系统,即使没有迫切需要语言翻译数据的需求。"
  为了解决这个难题,每个研究团队被分为更小的专家小组,他们致力于完善语言翻译系统,该系统的主要组成部分是:自动搜索、语音识别、翻译和文本概括技术,以上均适用于资源较少的语言。自 2017 年该项目开始以来,研究团队已经研究了 8 种不同语言,包括:斯瓦希里语、塔加拉语、索马里语和哈萨克语。
  其中一个突破是从网络上获取文本和语音,包括新闻文章、博客和视频内容,由于世界各地网络用户都在使用自己的母语发布信息,许多资源匮乏的语言在线数据也在不断增多。
  南加州大学计算机科学家斯科特・米勒说:"如果你搜索互联网,想获取索马里语的相关数据,你会找到上亿个单词,这是没有问题的,你可以在网络上获得几乎所有语言的文本资料。"
  以上在线数据通常是单一语言模式,意味着索马里语文章或者视频只能使用母语阅读,没有平行对应的英语翻译。但是米勒表示,神经网络模型可以在许多不同语言的单语数据上进行预训练。
  米勒称,在预训练过程中,神经模型学习了人类语言的一般结构和特征,然后可以将这些结构和特征应用到翻译任务中,没有人真正知道这些模型真正学到了什么结构,它们有数百万个参数。
  ▲打破语言障碍带来的好处远远超出了情报机构掌握到的信息
  一旦对多种语言进行预训练,这些神经模型就可以使用极少的双语训练(即并列数据)在不同语言之间进行翻译,几十万字的并行数据就足够了 —— 相当于几本小说的内容。
  在这个总结概括过程中,神经模型表现出一些最奇特的方式 —— 它们能产生"幻觉"。
  多语言搜索引擎能够梳理文本形式的语言,这将带来另一组复杂的问题,例如:语音识别和转录技术通常会遇到之前未遇到过的声音、名称和位置问题。
  英国爱丁堡大学语音技术专家彼特・贝尔是试图解决该问题的小组成员之一,他说:"我举的一个例子中所涉及的国家与西方国家相比不太出名,该国一个政客被暗杀,他的名字现在真的很重要,但在以前,这个名字很晦涩,并不引人关注,那么你如何在音频中找到这位政客的名字呢?"
  贝尔和同事采取的一种解决方案是再次检索那些被转录的带有不确定性的单词,翻译软件并不熟悉这些不确定性的单词,如果再次重新检索,很可能就会找到这位鲜为人知的政客的名字。
  一旦找到并翻译了相关信息,搜索引擎就会为用户进行汇总,在这个总结的过程中,神经模型会表现出一些最奇怪的特征 —— 产生"幻觉"。
  想象一下,当你正在搜索一篇关于星期一抗议者攻击某栋建筑的新闻报道,但搜索结果显示,抗议者的暴力行径是发生在星期四,这是因为神经模型在总结报告时,利用了基于数百万页训练文本的背景知识。在这些文本中,有更多的抗议者在星期四攻击建筑物,因此得出结论。
  类似地,语言翻译软件的神经模型可能在摘要概述中插入日期或者数字,计算机科学家称之为"幻觉"。
  爱丁堡大学计算机科学家米蕾拉・拉帕塔称,这些神经网络模型非常强大,它们记忆了很多语言,还添加了源程序中没有的单词。据悉,她正在为一支研究团队开发设计语言概述元素。
  米蕾拉和同事通常提取每个文档中的关键词来避免该问题,而不是让翻译软件使用句子进行总结,关键词不如句子优雅,但它们限制了该语言模型表达韵文诗歌的倾向。
  当新冠病毒大流行时,人们突然要将一些基本的健康提示翻译成多种语言。
  虽然语言搜索引擎是为现有语言而设计的,但是该项目包括了一个研究数千年、现无人使用的小语种,这些古老的语言资源非常少,因为许多语言仅以文本片段的形式存在,他们为可应用于现代低资源语言的技术提供了一个有效试验。
  麻省理工学院博士生 Jiaming Luo 和合作者共同开发了一种语言算法,可以计算出某些古代语言是否有现代存留,通过提供这些语言的基本信息,以及语言变化的通常状况,该语言算法获得了一个先行条件,基于以上信息,该语言模型能够独自获得一些发现,期间仅使用少量数据。
  ▲机器学习可以帮助破译已经灭绝的语言,比如公元前 14 至 12 世纪在叙利亚北部使用的乌加里特语
  通过这种语言算法,他们发现一种来自近东地区的古老语言乌加里特语与希伯来语密切相关,他们还得出结论称,一种古老的欧洲语言 —— 伊比利亚语,与其他欧洲语言相比,更接近于巴斯克语(但与巴斯克语的关联度并不高)。
  麻省理工学院计算机科学家蕾贾纳希望该方法能够激发更广泛的变化,并使神经模型不那么需要数据支持,事实证明,我们对大量并行语言翻译数据的依赖,已成为研发语言翻译系统的一个弱点,因此,如果我们真的研制好的技术,无论是用于解密,还是用于小型语言翻译,它都将推动整个领域向前发展。
  研究小组现已成功设计了多语言搜索引擎的基础版本,并用每种新语言对其进行改进,IARPA 项目经理鲁比诺认为,这些技术可以改变情报收集的方式,我们确实有机会彻底改变分析师对外语数据的学习方法,使讲英语的单语分析师获得之前无法处理的多语数据。
  当情报分析人员试图从外部获取资源稀缺的语言数据时,该语言的母语者们也在积极获得其他语言的重要信息,他们不是为了间谍活动,而是为了改善自己的日常生活。
  德国萨尔兰大学计算机科学博士生戴维・伊费奥鲁瓦・阿德拉尼说:"当新冠病毒全球流行时,突然需要将基本的卫生提示翻译成多种语言,由于翻译质量问题,我们无法使用机器翻译模型实现这一点,我认为开发多语言翻译软件教会我们很多东西,拥有适合于资源匮乏语言的技术是非常重要的,尤其是在我们急需的时候。"
  阿德拉尼来自尼日利亚,他的母语是约鲁巴语,他一直在创建约鲁巴语 - 英语互译的数据库,这是名为"打破非洲多语言障碍"的非赢利项目的一部分,他和研究团队通过收集翻译后的电影剧本、新闻、文学作品和公开演讲等资料,创建了一个新的数据集。然后,他们利用这个数据集对文本模型进行微调,以提高该数据集的准确性。在 Masakhane 等基层团体的帮助下,埃维语、契维语、卢干达语等其他非洲语言也在进行类似的努力。
  相信未来有一天,我们所有人都可能在日常生活中使用多语言搜索引擎,只需点击一个按钮,就能解锁世界知识,在此之前,真正理解一种资源匮乏语言的最好方法可能就是学习它,并加入多语言在线人类交流。

贝索斯聘前SpaceX高管开发卫星,跟马斯克星球大战北京时间4月8日讯,随着亚马逊的大力推出旗下卫星互联网计划Kuiper,人们发现该计划越来越像马斯克SpaceX的星链(Starlink)方案了,两家公司的计划均包含数千艘体积紧凑起名真的很难,天文学家公开征集木星五颗卫星命名IT之家2月28日消息日前,国际天文学联合会小行星中心计划为五颗木星的卫星命名,这五颗卫星中有三颗在2003年发现,另外两颗分别在2017年和2018年发现。目前已知木星有79颗卫30年后新进展!NASA哈勃望远镜发现海王星新卫星IT之家2月21日消息日前,英国自然杂志公布了一项新的研究发现,地外文明搜寻计划(SETI)团队发现此前从未观测到的海王星卫星,这也是海王星最小的卫星,其被命名为海马。这颗卫星是海中车四方时速600公里级高速磁浮真车首次亮相感谢IT之家网友刺客的线索投递!IT之家12月6日消息12月5日下午,杭州国际博览中心第二届浙江国际智慧交通产业博览会举行轨道交通真车展揭幕仪式,中车四方股份公司制造的时速600公南开大学团队研获高性能柔性有机太阳能电池IT之家11月6日消息根据南开大学官方的消息,自然电子学刊发了南开大学化学学院陈永胜教授团队的研究论文,介绍了他们在柔性透明电极与柔性有机太阳能电池领域研究中获得的突破性进展。南开这个AI学习了4。5万幅画之后,让你秒变梵高画作主角近日,研究人员推出了名为AIPortraits的网站,借助人工智能(AI)技术,你可以上传自拍照,然后看着它变成你的经典肖像。几秒钟之内,你就能成为梵高伦勃朗或提香画作中的主角。据人工智能完全取代人类?不存在的1956年,美国的达特茅斯学院首次提出了人工智能,毫无疑问,在那时,这是一个非常高大上并且遥不可及的概念。而当下,经过多年的研究和沉淀,人工智能已然不再显得高冷,人工智能企业也不再中科院成功种出钻石,1星期能长1克拉IT之家10月30日消息根据央视财经的报道,中科院种出了钻石,在实验室环境下,一星期即可培育一颗1克拉的钻石,其硬度和纯净度都可以媲美天然钻石,价格却只有天然钻石的六分之一。据介绍中国首颗软件定义卫星天智一号完成多项在轨试验IT之家7月6日消息据央视新闻报道,中国首颗软件定义卫星天智一号在轨试验取得大量阶段性成果,对多项新技术进行了在轨试验验证。软件定义卫星也被称为智能卫星,是指以天基先进计算平台和星不是愚人节恶作剧!SpaceX或下周发射猎鹰重型火箭据CNET报道,最早于美国当地时间下周一,埃隆马斯克(ElonMusk)旗下火箭公司SpaceX可能试射两枚下一代火箭,包括当前世界上最强大的火箭猎鹰重型火箭(FalconHeav其实科学家们给两个黑洞拍了照片,但只有一张洗出来了IT之家4月11日消息4月10日晚间,人类首张黑洞照片问世。照片的主角远在5000多万光年之外,位于遥远的M87星系的中央,质量约为太阳的65亿倍。据澎湃新闻报道,中科院上海天文台
百余科学家联合声明强烈谴责首例免疫艾滋病基因编辑婴儿IT之家11月26日消息今天微博知识分子发文称,针对全球首例免疫艾滋病基因编辑婴儿国内百余名科学家今天联名谴责,生物医学伦理审查形同虚设。直接进行人体实验,只能用疯狂形容。作为生物基因编辑婴儿伦理审查文件签字者称不知情未参会没签字IT之家11月26日消息据第一财经报道,日前,基因编辑婴儿的诞生震惊学术界,外界对此充满疑惑。有关于该项目的伦理审查申请文件上几位签字人员,其中一位委员表示不知情,包括受采访的委员首例基因编辑婴儿惹争议到底触犯了哪些边界?一对基因经过修改的双胞胎婴儿已于11月健康诞生,基因编辑使她们将来可能具有天然抵抗艾滋病的能力。这是世界首例免疫艾滋病的基因编辑婴儿,也意味着中国在基因编辑技术用于疾病预防领域实现涉事医院回应首例基因编辑婴儿事件没做过此项目11月26日消息,据人民网报道,来自中国深圳的科学家贺建奎在第二届国际人类基因组编辑峰会召开前一天宣布,一对名为露露和娜娜的基因编辑婴儿于11月在中国健康诞生。这对双胞胎的一个基因科技日报四问世界首例免疫艾滋病基因编辑婴儿IT之家11月26日消息日前,科学家贺建奎宣布世界首对免疫艾滋病的基因编辑婴儿在中国诞生,这一消息引发社会和科学界的广泛关注。其中的伦理问题成为辩论的焦点,针对这一事件,科技日报四SpaceX获得2。97亿美元军事发射合同,与波音分庭抗礼IT之家2月20日消息日前,美国五角大楼和空军宣布了发射任务的竞争结果,马斯克旗下的SpaceX公司及其竞争对手联合发射联盟将平分六次军事太空发射任务。据了解,SpaceX中标金额真的有地外生命吗?NASA成立寻找外星人的研究小组美国国家航空航天局(NASA)本周在硅谷成立了一支新的研究小组。该小组将致力于寻找地球以外的生命,探索有关生命如何在地球上起源以及生命在其他地方是否可能存在的问题答案。该研究小组名火星之旅不容易宇航员将遭受非常严重的太空辐射北京时间10月19日消息,据国外媒体报道,人类要想登上火星,将面对许多挑战。火箭宇航员和火星本身都是挑战的一部分。目前有很多探测器正围绕火星开展任务。其中一枚探测器通过测量宇航员前普通人上一次太空要多少钱?最便宜的不到200万元有史以来航天飞行往往是政府主导的活动,而且代价高昂。但随着SpaceX等私人太空企业的崛起,把人和有效载荷送入太空的高昂成本终于开始有所下降。图示SpaceX旗下的猎鹰9号火箭单次世界首例日本批准使用iPS干细胞治疗脊髓损伤的试验北京时间2月18日消息,在日本,每年大约有5000人遭受脊髓损伤,而患有某种脊髓相关损伤的人数估计超过10万人。对此,日本厚生省批准世界首例使用iPS干细胞治疗脊髓损伤的试验,使得昆虫睡眠状态十分特殊,或将揭晓人类睡眠谜团北京时间10月5日消息,据国外媒体报道,如果你观察一个疲惫困倦的婴儿,你会看到重力牵引他的眼睑下垂,同样的,昆虫也有它们独特的睡眠特征,处于睡眠状态的蜜蜂会将触角下垂。研究昆虫睡眠