python如何提取英语pdf内容并翻译
作者:Zuolyme 发布时间:2023-06-13 13:37:27
标签:python,翻译,pdf
本文实例为大家分享了python提取英语pdf内容并翻译的具体代码,供大家参考,具体内容如下
前期准备工作:
翻译接口: 调用的是百度翻译的api (注册后,每个月有2百万的免费翻译字符数。)
pdfminer3k: pdfminer3k是pdfminer的Python 3端口。 PDFMiner是一种从PDF文档中提取信息的工具。 与其他PDF相关工具不同,它完全专注于获取和分析文本数据。 PDFMiner允许获取页面中文本的确切位置,以及字体或线条等其他信息。 它包括一个PDF转换器,可以将PDF文件转换为其他文本格式(如HTML)。 它有一个可扩展的PDF解析器,可用于其他目的而不是文本分析。
要解析PDF至少需要两个类:PDFParser 和 PDFDocument,PDFParser 从文件中提取数据,PDFDocument保存数据。另外还需要PDFPageInterpreter去处理页面内容,PDFDevice将其转换为我们所需要的。PDFResourceManager用于保存共享内容例如字体或图片。
安装:pip install pdfminer3k
前期工作准备好后,即可开始代码编写。
# -*- coding: utf-8 -*-
import sys
import io
"""
Created on Sun Mar 3 12:22:49 2019
@author: Ben
"""
import importlib
importlib.reload(sys)
from pdfminer.pdfparser import PDFParser,PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontal,LAParams
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed
#from PyPDF2.pdf import PdfFileReader, PdfFileWriter, ContentStream
import requests
import string
import time
import hashlib
import json
##初始化
api_url = "http://api.fanyi.baidu.com/api/trans/vip/translate"
api_id = "" ##申请的百度翻译接口的id
cyber = "" ##申请的百度翻译接口的password
pdffile = "multinet.pdf" ##处理的pdf
ENtextfile = "ENmultinet.txt" ##存储提取的txt
CNtextfile = "CNmultinet.txt" ##存储翻译的结果
isTranslate = False ##是否将提取的英文翻译为中文
## 处理PDF
## 读取PDF的内容 filename是待处理的PDF的名字
###使用PDFminer读取
def getDataUsingPyPDF(filename):
parser = PDFParser(open(pdffile,'rb')) #以二进制打开文件 ,并创建一个pdf文档分析器
doc = PDFDocument() ##创建一个pdf文档
#将文档对象和连接分析器连接起来
parser.set_document(doc)
doc.set_parser(parser)
doc.initialize()
#判断该pdf是否支持txt转换
if doc.is_extractable:
#创建一个PDF设备对象
rsrcmgr = PDFResourceManager()
#创建一个pdf设备对象
laparamas = LAParams()
device = PDFPageAggregator(rsrcmgr, laparams=laparamas)
#创建一个PDF解释器对象
interpreter = PDFPageInterpreter(rsrcmgr, device)
contents = "" #保存读取的text
#依次读取每个page的内容
for page in doc.get_pages():
interpreter.process_page(page)
layout = device.get_result() # 这里layout是一个LTPage对象 里面存放着 这个page解析出的各种对象 一般包括LTTextBox, LTFigure, LTImage, LTTextBoxHorizontal 等等 想要获取文本就获得对象的text属性,
#在windows下,新文件的默认编码是gbk编码,所以我们在写入文件的时候需要设置一个编码格式,如下:
for x in layout:
if(isinstance(x,LTTextBoxHorizontal)):
results = x.get_text()
results = results.replace("\n","") #去掉换行符 因为排版问题 有的换行导致句子中断
contents += (results)
##为了看着舒服,每一句为一行
saveText(contents.replace(".",".\n"),ENtextfile)
return contents
## 将读取的content以txt格式存放到本地
def saveText(content,Textfile):
with open(Textfile,"w",encoding='utf-8') as f:
f.write(content)
## 翻译从pdf提取的content
def translate(content):
salt = str(time.time())[:10]
final_sign = str(api_id) + content + salt+ cyber
final_sign = hashlib.md5(final_sign.encode("utf-8")).hexdigest()
# from to 代表翻译的语言
paramas = {
'q':content,
'from':'en',
'to':'zh',
'appid':'%s'%api_id,
'salt':'%s'%salt,
'sign':'%s'%final_sign
}
my_url = api_url+'?appid='+str(api_id)+'&q='+content+'&from='+'zh'+'&to='+'en'+'&salt='+salt+'&sign='+final_sign
response = requests.get(api_url,params = paramas).content
content = str(response,encoding = "utf-8")
json_reads = json.loads(content)
return json_reads['trans_result'][0]['dst']+" "
###
content = getDataUsingPyPDF(pdffile)
print("读取pdf成功,将其保存为txt格式")
if(isTranslate):
clist = content.split(".") #split() 通过指定.将英文分成多个句子
i = 0
chinese = ""
print("一共有"+str(clist.__len__())+"行需要翻译")
print("开始翻译...请耐心等待")
while(i<clist.__len__()):
chinese += (translate(clist[i]).replace("\n","。"))
#chinese += '\n'
i+=1
saveText(chinese,CNtextfile)
print("翻译结束,ok")
来源:https://blog.csdn.net/zlyaxixuexi/article/details/88088899
0
投稿
猜你喜欢
- 如下所示:import osimport cv2import sysimport numpy as nppath = "F:\\I
- 问题描述项目中需要用到流程图,如果用js的echarts处理,不同层级建动态计算位置比较复杂,考虑用python来实现测试demo实现效果如
- 本文实例讲述了PHP编程文件处理类SplFileObject和SplFileInfo用法。分享给大家供大家参考,具体如下:php对于大文件的
- 根据我最近的一些实践以及在和一些读者进行关于HTML表格的使用问题沟通之后,决定写这篇文章。总的来说,我注意到由于误导性信息,他们对于tab
- 爬虫是大家公认的入门Python最好方式,没有之一。虽然Python有很多应用的方向,但爬虫对于新手小白而言更友好,原理也更简单,几行代码就
- 米随随在国外某站看到的国际上十四个优秀网页设计审核站,他发现还有中国的哦~HOHO~1.荷兰 strangefruits &nb
- 函数重载的替代方法-伪重载,下面看一个具体的实例代码。<? php//函数重载的替代方法-伪重载////确实,在PHP中没有函数重载这
- 在JavaScript中存在这样两种原始类型:Null与Undefined。这两种类型常常会使JavaScript的开发人员产生疑惑,在什么
- ConfigParser模块在python中用来读取配置文件,配置文件的格式跟windows下的ini配置文件相似,可以包含一个或多个节(s
- 数字范围:922337203685477~-922337203685477函数代码如下: <%Public Fun
- 如何在Typescript中使用for...in ?本人在TS中用for...in出现了些问题,也想到了一些解决方法。那么先来看看下面报错的
- 引用计数Python语言默认采用的垃圾收集机制是『引用计数法 Reference Counting』,该算法最早George E. Coll
- 1、异常简介从软件方面来说,错误是语法或是逻辑上的,当python检测到一个错误时,解释器就会指出当前流已经无法继续执行下去,这时候就出现了
- 数组我们已经提到过,对象是无序数据的集合,而数组则是有序数据的集合,数组中的数据(元素)通过索引(从0开始)来访问,数组中的数据可以是任何的
- 浏览器:IE ,不支持firefoxfilter视觉滤镜的种类:Alpha(透明度) Blur(模糊) Chroma(指定颜色透明) Dro
- 原文地址:30 Days of Mootools 1.2 Tutorials - Day 18 - Classes part IClass(
- 今天真的被编码问题一直困扰着,午休都没进行。也真的见识到了各种编码。例如:gbk,unicode、utf-8、ansi、gb2312等。如果
- PHP Warning: strtotime(): It is not safe to rely on the system's t
- 本文更多将会介绍三思在日常中经常会用到的,或者虽然很少用到,但是感觉挺有意思的一些函数。分二类介绍,分别是: 著名函数篇-经常用到的函数 非
- 本文实例讲述了PHP使用星号隐藏用户名,手机和邮箱的实现方法。分享给大家供大家参考,具体如下:PHP使用星号替代用户名手机和邮箱这个在许多的