用深度学习模型实现自动补全Python代码 (开源)

一行一行地敲代码就像是徒手搬砖,聪明的程序猿们表示:我们要解放生产力!

比如像这样:

在机器学习的时代,AI智能补全代码早已不是梦想,各种IDE和插件都在努力帮助程序猿减少击键次数,延长键盘寿命(雾。

有位来自斯里兰卡的程序猿也加入了关爱键盘协会,他尝试用简单的深度学习模型来实现自动补全Python代码这个目标,效果意外的不错。该项目现已 开源

简单的模型也强大

抱着实验的心态,在这个项目中,斯里兰卡小哥用到的只是一个简单的LSTM(Long Short-Term Memory)模型。

用来进行预测的算法是集束搜索(beam search),这是一种启发式图搜索算法。在进行每一步深度扩展时,集束搜索仅保留一些质量较高的节点,减少空间消耗,提高时间效率。采用集束搜索算法最多可以实现10个字符的预测。

而投喂给模型的数据是标记化的Python代码,这些代码里的注释、字符串和空行事先清理掉了。

训练效果是这样的:

绿色的字母就是自动补全开始的位置,按下TAB键选择补全,高亮标注为灰色的部分就是AI补充的代码。

小哥表示,如此简单的模型下,使用深度学习来自动补全Python代码,仍可以减少30-50%的击键次数,真的是surprise!

在GitHub上,小哥提供了一个Python的解析器,而只要写一个其他语言的解析器,这个方案完全可以推广到其他语言上,实现Java自动补全,C自动补全等等。

使用方法

想要亲测一下效果?

没问题,只需五步,你就可以训练自己的自动补全模型。

1、安装进行机器学习的实验环境( lab ,地址见文末)。

2、将数据复制到 ./data/source。

3、运行 extract_code.py 来收集所有的python文件,编码并将其合并到 all.py。

4、运行 evaluate.py 对模型进行评估。

5、运行 train.py 训练模型。

仍需成长

方法简单,效果还挺好,听上去这个项目很有潜力啊。不过理想很丰满,现实还是有点骨感的。这个新生的AI还是面临着许多成长挑战的。

挑战一:效率太低

首先是它的性能尚未能满足实际使用的需要。由于编辑集成器的限制,集束搜索算法效率低下,有等它补全代码的时间,手动都可以敲好几行代码了。

对此斯里兰卡小哥表示,下一步他们会尝试用不同的架构来提高推理性能,也欢迎大家向他们分享想法和建议。

挑战二:前辈强大

Reddit网友们还指出,用机器学习来补全代码这个想法早已有比较成功的实现方案,比如获得了Trith Ventures投资的 Kite

全球有超过3万名Python开发人员使用Kite,它被誉为当前最好用的Python自动补全工具。不仅能补全代码,Kite还能帮你跳过文档了解到别人是如何实时使用函数的,同时,它也能提供你的自定义代码库里的定义和用法。

连Python之父都忍不住为Kite点赞:这可真够酷的。

比起Kite这位前辈,小哥的这个项目还是非常稚嫩的,不过Kite并没有开源,其作为补充使用的云引擎也引起了有关安全性的质疑,有网友表示:

要是在工作上用了Kite,贵公司的法务部门怕不是要疯。

此外,还有网友好奇AI跟Pycharm比起来又如何?毕竟Pycharm的自动补全就已经挺好用了。

原文链接:https://www.shangyexinzhi.com/article/details/id-164026/

编辑于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏织云平台团队的专栏

攻城狮剁手攻略丨有了这些书,还要什么自行车?

? 平时一本正经,突然画风清奇 织云值此全民剁手狂欢佳节之际 特地为攻城狮们送上一份通过采访 精心挑选的书单 敬请笑纳 ? ? 《代码的未来》 “站在摩尔定律...

12650
来自专栏AI+BI智能数据分析

遵循因果性的可解释AI预测

过去(包括现在),我们经常能在很多数据分析或BI产品上看到:在稀稀落落的散点图上,顺势一划,勾勒出一条曲线,再在横向时间轴上延展若干时间跨度,然后有人就告诉你—...

14830
来自专栏计算机视觉战队

VALSE Webinar总结及问答记录

罗平,2011至14年港中文攻读博士师从汤晓鸥和王晓刚,16至17年商汤研究院访问任研究总监,18年港中文研究助理教授。近5年发表论文70余篇Google Sc...

12720
来自专栏磐创AI技术团队的专栏

深度学习模型大合集:GitHub趋势榜第一,两天斩获2000星

项目地址:https://github.com/rasbt/deeplearning-models

11640
来自专栏深度应用

[TensorFlow深度学习入门]实战十一·用双向BiRNN(LSTM)做手写数字识别准确率99%+

此博文是我们在完成实战五·用RNN(LSTM)做手写数字识别的基础上使用BiRNN(LSTM)结构,进一步提升模型的准确率,1000steps准确率达到99%。

28050
来自专栏深度应用

[PyTorch小试牛刀]实战四·CNN实现逻辑回归对FashionMNIST数据集进行分类(使用GPU)

结果分析 我笔记本配置为CPU i5 8250u GPU MX150 2G内存 经过测试,使用GPU运算CNN速率大概是CPU的12~15倍(23/1.7...

25020
来自专栏深度应用

[Keras深度学习浅尝]实战三·RNN实现Fashion MNIST 数据集分类

与我们上篇博文[Keras深度学习浅尝]实战一结构相同,修改的地方有,定义网络与模型训练两部分,可以对比着来看。通过使用RNN结构,预测准确率略有提升,可以通过...

19830
来自专栏深度应用

[MXNet逐梦之旅]练习六·使用MXNetFashionMNIST数据集RNN分类

我们需要注意的参数有hidden_size (int),num_layers (int, default 1)与layout (str, default 'TN...

11440
来自专栏深度应用

[PyTorch小试牛刀]实战五·RNN(LSTM)实现逻辑回归对FashionMNIST数据集进行分类(使用GPU)

结果分析 我笔记本配置为CPU i5 8250u GPU MX150 2G内存 使用CPU训练时,每100步,58秒左右 使用GPU训练时,每100步,...

19220
来自专栏深度应用

[深度学习工具]·极简安装Dlib人脸识别库

Dlib是一个现代化的C ++工具箱,其中包含用于在C ++中创建复杂软件以解决实际问题的机器学习算法和工具。它广泛应用于工业界和学术界,包括机器人,嵌入式设备...

38730

扫码关注云+社区

领取腾讯云代金券

年度创作总结 领取年终奖励