前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >4位谷歌工程师8分钟视频,带你了解计算机视觉(有字幕)

4位谷歌工程师8分钟视频,带你了解计算机视觉(有字幕)

作者头像
量子位
发布2018-03-30 15:06:48
7420
发布2018-03-30 15:06:48
举报
文章被收录于专栏:量子位量子位
安妮 编译整理 量子位 报道 | 公众号 QbitAI

到底什么是计算机视觉?

计算机视觉离我们并不遥远。我们经常挂在嘴边的AR、自动驾驶、人脸识别都是计算机视觉的一部分应用。但这样说来可能又太宽泛了。量子位找到一个视频,里面是一组来自Google的研究人员,一起谈计算机视觉的历史、现在和将来。

虽然都属于计算机视觉领域的专家,但这段视频里的被采访者来自谷歌不同的部门:

Serge Belongie分管移动端视觉;Bill Freeman主要研究PC端视觉;Julian Ibarz和Vincent Vanhoucle这两个小伙,则是机器人技术研究人员。

视频如下。量子位空耳听译,配好了字幕。

视频内容

另外,量子位从中截图了一部分内容。

Serge Belongie认为,计算机视觉主要包括四个方面,概括起来就是四个Re-开头的单词。首先需要让计算机学会识别(Recognition)图像,在此期间需要为计算机输入大量的被标记图像内容。

之后,需要进行图像重建(Reconstruction),我们输入的图像信息是二维的,但可以利用算法将之变成三维立体图形。

变成三维模型后,就需要进行图像配准(Registration)了。图像配准是一个比较专业的词汇,是指将不同时间、不同传感器(成像设备)或不同条件下(天候、照度、摄像位置和角度等)获取的两幅或多幅图像进行匹配、叠加的过程。

Serge认为这其实是教会计算机追踪图像,无论是道路上的行人,还是自动驾驶时追踪的车道、甚至是你自拍时的美颜相机,都是在进行图形配准。

最后,我们需要对图像进行重组(Reorganization)。在此阶段需要进行大量的无监督学习。就像小孩子在没有被告知的情况下认识这个世界一样,计算机需要在无标记信息的情况下重组图像。

如同最后Bill Freeman总结的那样,计算机视觉如此迷人就在于它那点让你惊奇的发现。我们看到的计算机眼中的世界,又何尝不是一种动人心魄的美呢。

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2017-05-14,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 量子位 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 安妮 编译整理 量子位 报道 | 公众号 QbitAI
相关产品与服务
人脸识别
腾讯云神图·人脸识别(Face Recognition)基于腾讯优图强大的面部分析技术,提供包括人脸检测与分析、比对、搜索、验证、五官定位、活体检测等多种功能,为开发者和企业提供高性能高可用的人脸识别服务。 可应用于在线娱乐、在线身份认证等多种应用场景,充分满足各行业客户的人脸属性识别及用户身份确认等需求。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档