首页
学习
活动
专区
工具
TVP
发布

极客智坊翻译服务升级:支持PDF翻译+批量网页翻译

Google 文档翻译的问题 最近两周给极客智坊新增了 PDF 文档翻译和批量网页翻译的能力,PDF 文档翻译要先支持顺序提取所有文字、链接、图片、表格,这一块还是挺复杂的,因为 PDF 本身是一个侧重表现层显示而非结构标准化的文档格式...,即便是强如 Google/DeepL 的 PDF 文档解析也有不尽如人意的地方,比如下面红框是 Google 翻译 https://arxiv.org/pdf/2310.15987.pdf 这篇论文的时候提取的图片...至于翻译质量,在非常有深度的行业内容翻译的时候,Google 翻译也并不准确,比如下面这个: 把代码都翻译了,这对于 IT 技术类的 PDF 文档来说,就非常不友好了。...所以,这里我需要选择更好的 PDF 文档提取技术然后通过 GPT 模型进行翻译,以解决信息完整性和翻译质量问题。尤其是 PDF 文档信息提取,耗费了非常多的时间和精力,不过终于还是解决了这个问题。...极客智坊 PDF 文档翻译翻译 PDF 文档,请进入极客翻译页面,点击顶部文档翻译Tab按钮,选择翻译用的AI模型和目标语言,然后点击上传按钮上传待翻译PDF文件即可,我们以前面 Google 翻译的那篇

25340
您找到你想要的搜索结果了吗?
是的
没有找到

复制即可翻译PDF文本翻译神器!这个“宝藏”翻译软件火了

与大多数翻译软件相比,这款软件最大的特点就是:复制一下,即可翻译。 ? 其中针对外文PDF内容复制翻译的优化,更是深得人心。...一般情况下,复制PDF内容并将其粘贴到网页翻译中时,会有额外的换行符,导致翻译出现乱码,翻译结果简直不忍直视,比如这样: ? 想要更好的翻译结果,就要一一删除这些换行符,阅读效率就大打折扣。...只需复制一下,悬浮窗就会自动出现翻译结果,不需要额外处理换行问题,翻译文本还能编辑。 ? 这款软件使用的是谷歌翻译的API,在翻译的质量和响应速度上都有保证。...除了“复制即可翻译”和“解决PDF复制翻译的问题”,这款软件还有其他很多功能。...智能翻译与智能字典 CopyTranslator会自动识别所复制的文字,然后根据所设置的源语言和目标语言自动翻译

2K20

python如何提取英语pdf内容并翻译

本文实例为大家分享了python提取英语pdf内容并翻译的具体代码,供大家参考,具体内容如下 前期准备工作: 翻译接口: 调用的是百度翻译的api (注册后,每个月有2百万的免费翻译字符数。)...它包括一个PDF转换器,可以将PDF文件转换为其他文本格式(如HTML)。 它有一个可扩展的PDF解析器,可用于其他目的而不是文本分析。...id cyber = "" ##申请的百度翻译接口的password pdffile = "multinet.pdf" ##处理的pdf ENtextfile = "ENmultinet.txt" ##...存储提取的txt CNtextfile = "CNmultinet.txt" ##存储翻译的结果 isTranslate = False ##是否将提取的英文翻译为中文 ## 处理PDF ## 读取PDF...__len__())+"行需要翻译") print("开始翻译...请耐心等待") while(i<clist.

1.8K20

【NSR特别专题】周志华:弱监督学习简介「全文翻译

本文是对周志华教授所写的《弱监督学习简介》的全文翻译。本专题的更多翻译文章将陆续刊出。...弱监督学习简介 作者:周志华 翻译:遢遢 校对:叶奎 宋平 雷智文 刘市祺 摘要 监督学习技术通过学习大量训练数据来构建预测模型,其中每个训练样本都有其对应的真值输出。...Wisconsin at Madison, Wisconsin, WI, 2010 [ http://pages. cs.wisc.edu/∼bsettles/pub/settles.activelearning.pdf...University of Wisconsin at Madison, Madison, WI, 2008 [ http://www.cs. wisc.edu/∼jerryzhu/pub/ssl ̇survey.pdf...NSR发表的所有论文全文可以在线免费阅读和下载。 本文经《National Science Review》(NSR,《国家科学评论》英文版)授权翻译,“机器学习”专题的更多翻译文章将陆续刊出。

1.1K11

推荐个不错的 Word 全文翻译和压缩工具!

最近我有个需求,那就是把一个 Word 文档全文翻译成英文版。 这个 Word 文档内容还不少,上百页了,而且中间还包含了很多图片,整体大小差不多 20 多MB。...我心想,虽然翻译工具不少,但能直接翻译 Word 我还真不知道,难道我得一点点复制粘贴来谷歌翻译?这就费了劲了吧。...打开之后页面很简洁,就是上传文档,如图所示: 下面还写着支持的文档类型,有 Word、PowerPoint、Excel、PDF,还有一些文本文档比如 RTF、TXT 等。 可以说是很强大了。...因为它是基于谷歌翻译的,所以谷歌翻译支持多少它就支持多少。...翻译之后的效果如下: 看起来很不错!该翻译的都翻译了,而且原来的格式都保留了,代码格式、段落格式都没有乱掉,另外其他的图片和排版也保持了原样,感觉还是非常不错的。

1.5K40

PDF Explained(翻译)第二章 构建一个简单的PDF

本文是对PDF Explained(by John Whitington)第二章《Building a Simple PDF》的摘要式翻译。 本章我们将使用文本编辑器手动构建PDF内容。...然后我们将使用 pdftk将其转换为有效的PDF文件,并在PDF查看器中进行查看。...关于PDFTK(THE PDF TOOLKIT) pdftk是一个开源的命令行程序,它的功能有: 合并分割PDF文档 旋转PDF页面 加解密 填充PDF表单 加水印和图章 打印和修改PDF元数据(metadata...第一行将文件标识为PDF并给出版本号: %PDF-1.1 //PDF version 1.1 header 第二行很难输入文本编辑器,因为它包含不可打印的字符。 我们将它留给pdftk处理。...文件,将输出写入hello.pdf: pdftk hello-broken.pdf output hello.pdf pdftk读取文件及其对象,修补错误同时将缺失数据补全。

1.2K30

SCI必备利器:PDF文献一键翻译

翻译软件一大堆,谷歌、有道、百度等等。段落翻译效果,只有谷歌一家勉强能用。对于PDF文档翻译,对不起,谷歌也是无能为力。 CopyTranslator有效的解决了这个问题。...相信我,你只需要这一款翻译软件。 复制即翻译 PDF格式无乱码 阅读英文文章早该这样了 小通刚开始接触英文文献时简直要疯了,一周只能看一篇文章。...网上找各种翻译工具,虽然都有段落翻译,但是也顶不住PDF复制粘贴的尴尬。 ▼PDF文本复制粘贴后格式乱码 ?...粘贴后出现很多分行符,PDF的超级Bug 相信大家都遇到过这个情况,从PDF文档复制出来的文本,粘贴后格式都很乱。不仅段落格式消失,几乎每个句子都会打乱。别说翻译了,复制出来引用都要从新排版一次。...复制PDF文本后,软件通过监听剪贴板,将文本内容格式化后,粘贴在文本框,并将其中文译为显示在下面的文本框中。整个过程仅花费数秒时间。 啥?

2.9K61

PDF Explained(翻译)第一章 简介

本文是对PDF Explained(by John Whitington)的摘要式翻译。 一. 一点历史 PDF的发展 PDF起初是Adobe的一个内部项目,其目标是创建一种平台无关的文档交换方式。...PDF1.0于1993发布,包括Acrobat Distiller(用于创建和编辑PDF文件)和Acroba t Reader(只能用于查看),两款软件都是收费的。...PDF的优点 随机访问和线性化 不同与PostScript,PDF中的任何对象均可在常数时间内任意访问。这意味着访问第150页不会比第1页更困难。...特殊种类的PDF 有一些PDF格式的特殊变体,它们是PDF的子集。每个文件都是一个合法的PDF文档,但是做了一些限制。其中的两个是PDF/A和PDF/X,他们有各自的ISO标准。...PDF/A PDF/A标准(ISO 190005-1:2005)定义了一套文档规则,主要用于图片馆,档案馆和一些机构的长期存档文件。

1.6K20

【NSR特别专题】张宇 杨强:多任务学习概述「全文翻译

本文为全文翻译。本专题的更多翻译文章将陆续刊出。...多任务学习概述 作者:张宇, 杨强 翻译:宋平,雷智文,刘市祺 校译:叶奎 摘要 多任务学习(Multi-Task Learning,MTL)是机器学习中一个非常有前景的方向,旨在通过利用多个相关的学习任务之间的有效信息来提升它们的性能...最后,“结论”部分对全文进行了总结。 多任务学习 首先,我们给出多任务学习的定义。 定义1....文中数字注明的应用文章,详见英文版PDF。...NSR发表的所有论文全文可以在线免费阅读和下载。 本文经《National Science Review》(NSR,《国家科学评论》英文版)授权翻译,“机器学习”专题的更多翻译文章将陆续刊出。

1.7K20

如何用Elasticsearch实现Word、PDF,TXT文件的全文内容检索?

Elasticsearch封装了Lucene,Lucene是apache软件基金会一个开放源代码的全文检索引擎工具包。...但是对于pdf,word这两种特殊格式,文件中除了文字之外有很多无关的信息,比如图片,pdf中的标签等这些信息。这就要求对文件进行预处理。...同是对文件的名字name指定分析器analyzer为ik_max_word,以让ElasticSearch在建立全文索引时对它们进行中文分词。 建立文档结构 测试 经过上面两步,我们进行简单的测试。...先通过下面的网站将一个pdf文件转化为base64的文本。PDF to Base64 测试文档如图: 测试文档 然后通过以下请求上传上去,我找了一个很大的pdf文件。...没有指定pipeline的情况 根据结果我们看到,我们的PDF文件已经通过我们自行定义的pipline,然后才正式进入索引数据库docwrite。

3.2K31

爬虫爬取英文文档存为PDF,在读取PDF自动翻译文档

这几天在爬了Python的官方文档,但是它里面全是英文,只有数字,没有汉字,原谅我这个英语渣渣搞不懂,只能靠翻译了,如果是复制到百度翻译的话太慢,耗时间。...所以就直接用爬虫来搞了,自动化翻译文档 这是百度翻译的页面 ? 刚开始想用urllib去做,但是给我报了一个我的浏览器版本太低了,估计就是得加headers和UA。...这个简单,直接可以使用requests或者urllib抓取,然后转换成pdf。我的是在框架里面,有点麻烦,如果你觉得麻烦可以直接请求。...我是直接将一个div里面的这个内容全部拿下来,然后拼接一个新的html,将这个新的HTML转换成PDF。...第二阶段就是打开这个pdf,读取该文档,将其发送到百度翻译的框框,获取翻译的结果,重新保存 -----------读取文档-------- def read_pdf_to_text(self

1.4K20

怎么快速、免费将外文PDF文档翻译为中文?

在我们日常生活中可能会接触到众多外文PDF资料,那么我们怎么才能把他们快速翻译成中文呢?今天给大家分享几个小方法。...第一种方法(office word 2013或以上版本,网络): 右键点击PDF文件选择“打开方式”>>”Word 2016“ ? 打开以后选择“审阅”>>“翻译”>>“翻译文档” ?...第二种方法: 如果你想翻译的准确一点或者更美观一点,可以试一下一下方法(chrome或其他可以安装谷歌翻译插件的浏览器、Google翻译插件、可以登录Google.com的网络环境、office2013...或以上版本或其他可以将PDF转为网页文档的软件) 和第一种方法的第一步一样,右键点击PDF文件选择“打开方式”>>”Word 2016“ ?...打开后点击Google翻译插件>>翻译此页面(如果不反应可以多点击几下)就可以了。 ? 翻译后效果: ? 第2.5个方法 如果大家的电脑不能使用Google翻译,或者没有安装chrome。

4.6K20

PDF Explained(翻译)第三章 文件结构

本文是对PDF Explained(by John Whitington)第三章《File Structure》的摘要式翻译。...Header PDF文件的第一行指出了文档版本号。在我们的示例中,是: %PDF-1.1 指明了该文件是PDF 1.1版本。...系统是向后兼容的,因此线性化的PDF文件也可视为普通的PDF,可以被不支持线性化PDF的阅读器读取。 线性化的PDF文件可以通过文件顶部(header之后)的线性化字典加以识别。...例: pdfopt input.pdf output.pdf 这会将input.pdf线性化并将结果写入output.pdf。...如何读PDF文件 要读取PDF文件,将其从一系列字节转换为内存中的“对象图”,通常有如下步骤: 从文件开头读取PDF header,确认这确实是PDF文档并获取其版本号。

1.2K40
领券