前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >快别「一句wòcào行天下」,清华开源了个神器专治词穷!

快别「一句wòcào行天下」,清华开源了个神器专治词穷!

作者头像
张俊红
发布2022-05-23 11:21:01
5000
发布2022-05-23 11:21:01
举报
文章被收录于专栏:张俊红
鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI

奈何本人没文化,一句(哔——)行天下。

这位胖友,不知你行走江湖,是否也有过这样的烦恼?

那么这里有个神器,可就值得好好说道说道了。

“听我说谢谢你,因为有你,温暖了四季”用成语应该怎么说?

在搜索框内输入你想表达的意思,再在词性一栏里选择成语,AI立马就能给你抛出几十上百个选项。

背景颜色越深,代表系统推荐程度越高。

要是碰上啥看不懂的,鼠标一点,就能查看具体释义。

还不只是中文,比如当你想脱口而出一句“鹅妹子嘤”,但又想知道有没有更华丽的中文表达,同样是一键即可得。

怎么样,够方便不?

是不是有点“妈妈再也不用担心我词穷”内味儿了(手动狗头)。

来自清华的“反向词典”

这个神器名叫WantWords,反向词典

背后的AI,来头不小:诞生自清华大学自然语言处理与社会人文计算实验室,项目指导教师为孙茂松教授和刘知远副教授。

所谓“反向”,就是和常规词典不同,不是按词寻义,而是反过来给词典一段描述,让它来帮你找词。

作者在GitHub中介绍,他们希望反向词典起到三种作用:

解决话到嘴边,却忽然想不起来怎么说的“舌尖现象” 帮助新语言学习者 帮助无法选择单词的失读症患者

这个反向词典背后的核心AI,名为多通道逆向词典模型,相关论文还中选过AAAI 2020。

具体而言,多通道逆向词典模型采用了双向LSTM(BiLSTM)和注意力作为基本框架,并在其中加入了4个特定特征预测器。

采用多个预测器来识别输入查询中目标词的不同特征,一方面,能使嵌入质量较差的目标词通过特征被挑选出来。

另一方面,也可以过滤掉与正确目标词有接近嵌入、但存在矛盾特征的词。

也就是说,AI选词能更精准。

而为了让AI更容易找到真正“正确”的词,除了词性、词素这两个词语的“内部特征”外,作者还考虑了层次体系义原这两个“外部特征”。

所谓层次体系,是用来区分一个词是实体还是概念,实体下面又会分出各种各样的实体。

义原在语言学中则是指最小的不可再分的语义单位。语言学家认为义原体系在任何语言中都适用,不与特定语言相关。

举个例子,“男孩”这个词可以由“人类”、“男性”、“儿童”这个三个义原表示,“女孩”则可以由“人类”、“女性”、“儿童”的组合来表达。

图源:HowNet

新算法已测试,相关新系统开发中

前文提到,WantWords反向词典最早诞生于清华NLP实验室,主要由岂凡超和张磊在2019年合作完成。

在与果壳交流时岂凡超谈到,刚开始,他们并没有对这个项目进行推广,只是身边的同学使用后反馈还不错。

直到去年11月,这个项目突然火爆,一时之间访问量暴增,把服务器都给挤垮了。

自此之后,WantWords开始受到更多关注,也收获了不少建议和来自志愿者的技术支持。

不仅有了网页版,微信小程序也已正式上线,还有APP版正在开发中。

微信小程序“WantWords”

根据研发团队的最新公告,今年除夕之前,反向查词还测试完成了新算法,其性能相较于原有算法有显著提高。

而在反向词典之外,研究团队还开发“名言名句语义检索及推荐系统”,以及“汉语词语搭配查询系统”。

目前这两个系统尚未对外开放,感兴趣的小伙伴可以边读论文(文末奉上),边蹲一波。

对了,研发团队还表示,WantWords作为一个开源项目,随时欢迎大家加入,参与设计&开发、提出需求、反馈问题。感兴趣的话就去官网戳戳公告吧~

相关论文: https://arxiv.org/abs/1912.08441 https://arxiv.org/abs/2202.13145

参考链接: [1]官网:https://wantwords.net/ [2]果壳文章:https://mp.weixin.qq.com/s/er-JwST7dUQjMh6VzBE1bA [3]https://deeplang.feishu.cn/docs/doccnoH9ncCZspo2Ubx79bpZ0Lh#ijyigh

END -

代码语言:javascript
复制
对比Excel系列图书累积销量达15w册,让你轻松掌握数据分析技能,可以在全网搜索书名进行了解选购:
本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2022-05-21,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 俊红的数据分析之路 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 来自清华的“反向词典”
  • 新算法已测试,相关新系统开发中
相关产品与服务
云开发 CloudBase
云开发(Tencent CloudBase,TCB)是腾讯云提供的云原生一体化开发环境和工具平台,为200万+企业和开发者提供高可用、自动弹性扩缩的后端云服务,可用于云端一体化开发多种端应用(小程序、公众号、Web 应用等),避免了应用开发过程中繁琐的服务器搭建及运维,开发者可以专注于业务逻辑的实现,开发门槛更低,效率更高。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档