腾讯 AI Lab 计算机视觉中心人脸 & OCR 团队近期成果介绍(1)

导语:腾讯 AI Lab 计算机视觉中心人脸&OCR 团队专注于领域内国际前沿技术研究与应用,近期取得部分成果,这里和大家分享一下。

1. 人脸检测研究进展 

1.1 WIDER FACE 评测结果

WIDER FACE 是由香港中文大学维护的人脸检测国际权威评测平台,包含训练集、验证集和测试集,总共有 3.2 万张图像,39 万个标注人脸,标注人脸有很大程度的尺寸、姿态和遮挡等变化,是目前国际上最大的也是最有挑战性的人脸检测的国际评测平台。WIDER FACE 数据集提供了三个子数据集(Easy、Medium、Hard)用于性能评估,采用 PR 曲线评测算法性能。我们团队研发的人脸检测算法 Face R-CNN 在 WIDER FACE 的三个子数据集(Easy、Medium、Hard)的验证集和测试集上均取得了第一的成绩(如下图),该结果已于 6 月初发表于 WIDER FACE 的官网上(http://mmlab.ie.cuhk.edu.hk/projects/WIDERFace/WiderFace_Results.html) 。相关技术文档(Hao Wang, Zhifeng Li, Xing Ji, Yitong Wang. Face R-CNN. arXiv preprint arXiv:1706.01061, 2017.)也已发布在 arXiv 上(https://arxiv.org/abs/1706.01061)

图 1. WIDER FACE 上的评测结果对比 

图 2. WIDER FACE 上的人脸检测结果样例(绿框是我们检测到的人脸,红框是官方发布的人脸)。

1.2 FDDB 评测结果

FDDB(Face Detection Data Set and Benchmark)是美国马萨诸塞大学维护的人脸检测国际评测平台。它是一个无约束自然场景的人脸检测数据集,该数据集总共包含不同自然场景下拍摄的 2845 张图像,5171 个标注人脸,使用 ROC 曲线评测算法性能。我们团队研发的 Face R-CNN 算法在 FDDB 上也取得了国际领先的成果,我们在 2000 个误报样本的条件下取得了 98.74%的召回率,排名第一。该结果也已于 6 月初发表在 FDDB 的官网上。

相关链接:http://vis-www.cs.umass.edu/fddb/results.html

图 3. FDDB 上我们的离散 ROC 曲线(discrete ROC curve)和近期 published 经典方法的对比。

 表一. FDDB 上的离散得分性能对比(2000 误检数时)

图 4. FDDB 上的人脸检测结果样例(绿框是我们检测到的人脸,红圈是官方发布的人脸)。

2. OCR 研究进展 

ICDAR(International Conference on Document Analysis and Recognition)是一个聚焦于 OCR 领域技术研究的国际权威会议,设有多项竞赛,和公司业务接近的有互联网图片(Born-Digital Images)和自然场景图片(Focused/Incidental Scene Text Images)中的文本提取的竞赛,每个竞赛包含定位、分割、识别和端到端四个任务。近来由于 RNN 的出现,对于检测到的单词可以直接去做识别,所以分割这个任务已没有太大意义。我们团队针对 TEG 的业务范围,目前聚焦在互联网图片上。 

2.1 ICDAR Born-Digital Images Task1 Text Localization

Born-Digital 文本检测任务在网页图像构成的数据集上进行,训练集 410 幅,测试集 141 幅。在训练网络时,对训练集进行多种变形,扩充,实际训练集在 4000 幅左右。采用 FCN 作为检测网络,在文本检测任务上取得了第一名的成绩。

相关链接:http://rrc.cvc.uab.es/?ch=1&com=evaluation&task=1

图 5. 文本检测任务上的排名

图 6. 部分检测结果及评价标准,更多的结果可在网站上查询。 

2.2 ICDAR Born-Digital Images Task3 Word Recognition

Born-Digital 单词识别任务在上述图像中抠出单词区域,四个边界向外扩展 4 个像素点,构成数据集,训练集 3567 幅,测试集 1439 幅。在训练网络时,使用外部数据集约 900 万幅。采用 CNN 提取图像特征,采用 RNN 学习序列关系,进行识别,在单词识别任务上取得了第一名的成绩。

相关链接:http://rrc.cvc.uab.es/?ch=1&com=evaluation&task=3

图 7. 单词识别任务上的排名

图 8. 部分识别结果及其评价标准,更多的结果可在网站上查询

团队秉承"专业、服务、伙伴"的理念,不断夯实基础,做有原创性的研究和坚实的工作,为伙伴部门提供高品质的技术支持,目前已承担多项部门内和跨部门的合作项目。

原创声明,本文系作者授权云+社区-专栏发表,未经许可,不得转载。

如有侵权,请联系 yunjia_community@tencent.com 删除。

编辑于

我来说两句

1 条评论
登录 后参与评论

相关文章

来自专栏上善若水

CG006读《什么是计算机图形学》

计算机图形学(computer Graphics) 是研究计算机世界中图形的学问。

902
来自专栏AI研习社

用两万篇论文告诉你:机器学习在过去五年中发生了什么

arXiv.org 很多人都知道,是一个专门收集物理学、数学、计算机科学与生物学论文预印本的网站。数据显示,截至 2014 年底的时候,arXiv 已经达到了一...

39516
来自专栏企鹅号快讯

谷歌AI新升级,装备审美功能给照片评分

腾讯数码讯(邱明慧)情人眼里出西施,对于我们这些平凡的用户来讲,这句话往往是正确的。总有人偏爱自己的拍摄出的图片,因为其中有自己的爱人、宠物和见闻。但往往拍摄某...

2105
来自专栏腾讯高校合作

【犀牛鸟·视野】SIGGRAPH Asia 2017:人脸动画最新技术进展

人脸动画在近些年来一直是图形学界的研究热点,随着Apple 推出最新的IphoneX,把人脸扫描和动画相关技术商业化,此类技术在将来会有越来越多的产品落地。此次...

3264
来自专栏专知

ICML2018 模仿学习教程

【导读】机器学习领域最具影响力的学术会议之一的ICML于2018年7月10日-15日在瑞典斯德哥尔摩举行。ICML是机器学习领域顶级会议,由国际机器学习协会(I...

902
来自专栏企鹅号快讯

你开车低头看个微信消息都能被拍的清清楚楚,因为有这些黑科技

机器视觉图像处理被广泛应用于交通领域(车辆检测) 相对于国外,国内将机器视觉图像处理技术应用于交通的发展,在近年已经有相当程度的进步,如国内目前相当热门的车牌识...

1918
来自专栏计算机视觉life

智能手机双摄像头工作原理详解:RBG +RGB, RGB + Mono

前一篇介绍了为什么会出现双摄像头(简称双摄)手机以及它的典型应用,下面来分析一下双摄的工作原理。 由于双摄技术的快速发展,目前已经衍生出了几种不同的双摄硬件和...

24210
来自专栏计算机视觉life

智能手机双摄像头原理解析:RGB +Depth

本篇来探讨一下智能手机摄像头中:普通彩色相机(RGB) + 深度相机(Depth)的技术原理。 首先来解释一下什么是深度相机吧。 深度相机 顾名思义,深度相机就...

3065
来自专栏机器之心

深度 | 可视化分析ICLR 2018:你想要的接收论文情况都在这

2646
来自专栏华章科技

大数据深度学习下车辆厂牌型号识别

车辆身份识别系统是智能交通的重要分支,它需要人工智能、图像处理、计算机视觉、模式识别等相关技术的综合应用。目前国内的车牌识别技术已经日益成熟,随着智能交通技术应...

582

扫码关注云+社区