牛!谷歌向量空间法:图片译成文字

大数据文摘翻译作品

翻译:阚玺(Cathy Xi Kan)

校正:孙强

如需转载,后台留言申请授权

概述:谷歌工程师利用和语言翻译类似的技术开发出了一个用于翻译图片主题的机器学习算法

将一种语言自动翻译成另一种语言一直以来都是难以攻克的问题。但最近几年,谷歌通过开发机器翻译算法改变了传统的翻译过程,通过谷歌翻译从本质上改变了跨文化翻译交流。

如今,谷歌正在运用同样的机器学习技术将图片转变为文字。其结果就是自动产生能够准确描述图片内容的标题。该技术将用在互联网搜索引擎,图片自动发表,视觉受损者的网页浏览,以及其他更为广阔的领域。

翻译语言的传统步骤是一个更迭的过程 - 从个体单词的翻译开始,然后通过重新排列单词和短语的顺序来提高翻译的准确性。但是近几年来,通过完全不同的方式,谷歌已经能够运用自己超大规模的搜索数据库来转换文字。

谷歌运用的方法的本质是统计相邻或相近单词出现的频率,并且在向量空间中定义他们之间的关系。通过这样的方法,每一个单词就可以用一个向量在空间中表示出来,每一个句子则是不同向量的组合。接下来谷歌做了一个重要的假设 - 无论什么语言,特定的单词之间具备相同的关系。例如,在所有语言中,向量“国王-男人+女人=皇后”都应该是一个真命题。

这就使得语言翻译成为了向量空间学里的一个问题。谷歌翻译是通过这一方式实现这一过程的:先把句子转换成向量,然后使用这个向量产生意思相同,另一种语言的句子。

现在Oriol Vinyals 和他在谷歌的合作者们正在使用类似的方法将图片转化为文字。他们的技术是使用神经网络去学习10万个图片的数据集合以及他们的标题,以此来实现如何对这些图片的内容进行分类。

但是除了生成一组可以描述图片的单词,他们的算法同样可以生成代表单词之间关系的向量。这个向量可以和谷歌现有的翻译算法结合起来去生成英语标题,或者任何其他语言的标题。事实上,谷歌的机器学习方法已经可以将图片转换为单词。

为了考量这种方法的效果,他们从亚马逊的”mechanical turk” (提供不同技能的劳动力资源平台)雇佣了评估者来对通过上述方法自动产生的标题,以及其他方法和人工翻译的标题进行评分。

结果显示被谷歌叫做神经图片标题(Neural Image Caption, NIC)的新系统非常成功。使用一个叫做PASCAL的被大家所熟知的图片数据集,神经图片标题的翻译功能明显超出其他的非人工翻译方法。据Vinyals说,NIC的BLEU (wiki) 分数是59,现今最好的非人工翻译技术的分数是25,人工翻译的分数是69。

这是个不错的结果,并且随着训练数据集的增大,这个方法产生的结果会更好。“从实验中我们非常清楚地看到,由于数据集的增大,NIC的翻译功能也相应得到提高。”谷歌团队说。

下图是一组图片翻译结果的示例-按翻译结果评分分组:

很明显,这是另一个在不久的将来机器会超越人类的项目。谷歌原论文题目:Show and Tell: A Neural ImageCaption Generator

论文链接:arxiv.org/abs/1411.4555

编者注:最近升级版的“谷歌翻译“中,已经增加了类似的功能,叫做“Word Lens“,下文摘自雷锋网(leiphone.com)

原文链接 http://www.leiphone.com/news/201501/4d8lzMhsZBfqy1NG.html

iOS版谷歌翻译推出了更新版本,新版本增加了“Word Lens”功能,可以直接对镜头捕捉到的文字图像进行实时翻译,并显示在相机视图上。并且,即使在没有网络连接的时候也能使用。遗憾的是,目前支持翻译的文字有限,仅包括英语、法语、俄语、德语、意大利语、葡萄牙语和西班牙语,不过未来会支持更多语言。

此外,新版本还增加了实时会话模式,可以在双方使用自然语速进行语音对话时,自动识别双方的语种并进行实时翻译。

摘自:MIT TechnologyReview

原文链接:

http://www.technologyreview.com/view/532886/how-google-translates-pictures-into-words-using-vector-space-mathematics/

译者:Cathy Xi Kan简介

阚玺(Cathy Xi Kan) 2012年获得了美国纽约州伦斯勒理工学院(Rensselaer Polytechnic Institute)决策科学专业(Decision Science)的博士学位。在她4年的博士学习中,Cathy对于决策模型的建立,运筹管理以及数据挖掘与分析等多项领域产生了浓厚的兴趣。毕业后,Cathy成为了一名资深的商业决策分析师,先后加入全美第二大肿瘤研制中心(Memorial Sloan-Kettering Cancer Center)的战略计划团队和全美第一大电子折扣网站(RetailMeNot, Inc.)的商业智能和分析团队工作。这些团队主要负责运用大数据分析向公司管理决策层提供有价值的商业决策建议。

2015年Cathy希望通过大数据文摘平台广泛结交业内人士及爱好者,并希望有机会多多参与国际国内大数据和电子商务相关的会议及交流活动。有意者可后台留言或私信。

大数据文摘,WeMedia自媒体联盟成员之一

原文发布于微信公众号 - 大数据文摘(BigDataDigest)

原文发表时间:2015-01-17

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏量子位

卸载美图秀秀吧,谷歌和MIT用机器学习帮你在拍照前修图

安妮 编译自 The Verge 量子位出品 | 公众号 QbitAI 你去票圈发照片的时候肯定也先修修图。少则几秒加个滤镜,多则数十分钟精修一下美美颜。 以后...

3516
来自专栏数据派THU

独家 | 人工智能技术在医学领域的应用与前景(附PPT)

[导读]2017年6月20日,零氪科技首席架构师王晓哲,在清华大学“天池医疗AI大赛”第一季肺部结节智能诊断 《医学影像在肿瘤诊疗中的应用及智能诊断探索》发表演...

8447
来自专栏玉树芝兰

如何有效沟通你的机器学习结果?

他说,许多人跑模型,跑出来一个比别人都高的准确率,于是就觉得任务完成了。他自己做健康信息研究,通过各种特征判定病人是否需要住院治疗。很容易就可以构建一个模型,获...

985
来自专栏PPV课数据科学社区

程序员为什么要学深度学习?

转自:infoq( ID:infoqchina) 导读 深度学习本身是一个非常庞大的知识体系。本文更多想从程序员的视角出发,让大家观察一下深度学习对程序员意味...

3785
来自专栏机器人网

中科院发布寒武纪深度神经网络处理器是什么?

第三届世界互联网大会于2016年11月16日在浙江乌镇召开,并举办了领先科技成果发布会。其中中国最引人注目的就是中国科学院计算技术研究所发布了寒武纪深度神经网络...

31010
来自专栏华章科技

程序员为什么要学深度学习?

深度学习本身是一个非常庞大的知识体系。本文更多想从程序员的视角出发,让大家观察一下深度学习对程序员意味着什么,以及我们如何利用这样一个高速发展的学科,来帮助程序...

1091
来自专栏CDA数据分析师

初学者如何从零学习人工智能?

? 链接:oschina.net/news/78629/beginners-how-to-learn-from-zero-artificial-intelli...

4167
来自专栏杨建荣的学习笔记

人机大战第二回合后的思考(r12笔记第75天)

古希腊哲学家普罗泰戈拉说道:人是万物的尺度。在人工智能时代的今天,这句话更有深意,已经不是单纯的抒情了。 今天是AlphaGo和柯洁的第二场比赛。在谷歌De...

3616
来自专栏AI研习社

上交大卢策吾团队 AlphaPose 更新,顶级性能的实时姿态估计

AlphaPose 是一个多人姿态估计系统,具有极高的精准度。据卢策吾团队介绍, AlphaPose 在姿态估计(Pose Estimation)标准测试集 M...

1954
来自专栏CVer

大牛分享 | 李航教授展望自然语言对话领域:现状与未来

本文经机器之心(微信公众号:almosthuman2014)授权转载,禁止二次转载

1320

扫码关注云+社区

领取腾讯云代金券