9赞

python实现翻译word表格小程序

作者：保佑欣疼你的芯疼 | 2021-12-11 19:58

这篇文章主要为大家详细介绍了python翻译word表格小程序，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下

背景

原是弱电集成的设计员，纠结很久后参加了python培训机构转职后的一员小白，由于一次工作中需要翻译一份近100页word表格，纯手工翻译大概三个小时，为了解决这种重复又耗时的劳动，并重温python相关知识所以制作了该小程序。

脚本详情

import re
import docx
import time
import pandas as pd
from selenium import webdriver
from selenium.webdriver.chrome.options import Options # 导入chrome选项
from selenium.webdriver.common.keys import Keys
from os import system
'''
seleium爬虫效率很低但胜在不用考虑反爬问题，由于想加快翻译速度并实现转换为exe文件后可在其他无python环境中运行，
添加excel表格充当数据库，excel文件中，一列命名漏洞英文列表，一列命名漏洞翻译列表，由于使用seleeium需在python目
录下添加对应浏览器driver，由于我使用的是chrome所以需下载chromedriver。
'''
def mydoc(doc,table,huan,expath):
 table_contents = []
 table_content_trans = []
 for i in range(0,len(table.rows)):#设定i值极限 行
 data = pd.DataFrame(pd.read_excel(expath))
 datalist_d = data['漏洞英文列表']
 datalist_t = data['漏洞翻译列表']
 i_text = table.cell(i,0).text#表格内i行j列单元格内容赋值给i_text
 zhPattern = re.compile(u'[\u4e00-\u9fa5]+') # 中文字符范围
 szPattern = re.compile(u'[0-9]') # 数字范围
 # spPattern = re.compile(u'[/]+')
 contents = u'{}'.format(i_text) # 表格内单元格文本
 # search整个字符串内查找模式匹配，找到第一个匹配然后返回一个包含匹配信息的对象，无则NONE
 # match匹配字符串第一位，开头位置是否匹配，匹配成功才会返回结果，否则返回None
 #'[^?\\/]'返回指定标点符号
 match_zh = zhPattern.search(contents)
 match_sz = szPattern.match(contents)
 if match_zh or match_sz:
 pass

 else:
 if len(datalist_d) != 0:
 flag_excel = False
 for j in range(len(datalist_d)):
  if datalist_d[j] == i_text:
  table.cell(i,0).text = str(datalist_t[j])
  flag_excel = True
  break
 if flag_excel == False:
  print('漏洞库中未搜索到...')
  table_contents.append(i_text) # 表格内内容
  trans_result = myspider(i_text) # 翻译表格内容
  print('翻译中...')
  if huan == 1:
  trans_result_n = trans_result.replace("\n", "") # 内容去除换行
  table.cell(i, 0).text = trans_result_n # 替换表格内容
  table_content_trans.append(trans_result_n) # 翻译和排版后内容加入表格
  data_t = pd.Series({"漏洞英文列表": i_text,"漏洞翻译列表": trans_result_n}, name='漏洞库') # 添加数据
  data_add_t = data.append(data_t) # 添加数据
  data_add_t.to_excel(expath, index=False) # 存入excel中
  print('存入漏洞库...')
  else:
  table.cell(i, 0).text = trans_result # 替换表格内容
  table_content_trans.append(trans_result) # 翻译和排版后内容加入表格
  data_t = pd.Series({"漏洞英文列表": i_text,"漏洞翻译列表": trans_result}, name='漏洞库') # 添加数据
  data_add_t = data.append(data_t) # 添加数据
  data_add_t.to_excel(expath, index=False) # 存入excel中
  print('存入漏洞库...')

 else:
 print('漏洞库为空')
 table_contents.append(i_text) # 表格内内容
 trans_result = myspider(i_text) # 翻译表格内容
 print('翻译中...')
 if huan == 1:
  trans_result_n = trans_result.replace("\n", "") # 内容去除换行
  table.cell(i, 0).text = trans_result_n # 替换表格内容
  table_content_trans.append(trans_result_n) # 翻译和排版后内容加入表格
  data_t = pd.Series({"漏洞英文列表": i_text,"漏洞翻译列表": trans_result_n}, name='漏洞库') # 添加数据
  data_add_t = data.append(data_t) # 添加数据
  data_add_t.to_excel(expath, index=False) # 存入excel中
  print('存入漏洞库...')
 else:
  table.cell(i, 0).text = trans_result # 替换表格内容
  table_content_trans.append(trans_result) # 翻译和排版后内容加入表格
  data_t = pd.Series({"漏洞英文列表": i_text,"漏洞翻译列表": trans_result}, name='漏洞库') # 添加数据
  data_add_t = data.append(data_t) # 添加数据
  data_add_t.to_excel(expath, index=False) # 存入excel中
  print('存入漏洞库...')

 #判断列表中是否都是空字符串
 flag = False
 for i in table_contents:
 if i.strip() != '':
 flag = True
 # 空列表或者列表中都是空字符串不翻译
 if len(table_contents) == 0 or flag == False:
 return print("此表格无需翻译或漏洞库中已存储")
 else:
 print('表格待翻译内容:',table_contents)
 print('表格翻译后内容:',table_content_trans)

def myspider(text):
 # 设置chrome浏览器无头模式
 chrome_options = Options()
 chrome_options.add_argument('--headless')
 driver = webdriver.Chrome(chrome_options=chrome_options)
 # driver.fullscreen_window() #全屏
 driver.maximize_window() # 屏幕最大化
 # 打开有道翻译页面
 driver.get("http://fanyi.youdao.com/")
 time.sleep(0.5)
 # 获取页面名为inputOriginal的id标签的文本内容
 inputwd = driver.find_element_by_id("inputOriginal") # 搜索输入文本框的id属性值 .text #id="wrapper"的所有文本
 but = driver.find_element_by_id('transMachine') # 搜索提交按钮//*[@id="transMachine"]
 outputwd = driver.find_element_by_xpath('//*[@id="transTarget"]') # 翻译后文本框
 inputwd.clear() # 清除文本框里的内容
 # outputwd.clear() # 清除文本框里的内容
 inputwd.send_keys(text) # 输入翻译内容
 but.send_keys(Keys.RETURN) # 输入回车键 but.click() #点击按钮s
 time.sleep(0.5)
 result = outputwd.text
 # 关闭浏览器
 driver.quit()
 return result

def mymain():
 # urlname = input('输入路径:')
 docname = input('输入文件全名：')
 huan = int(input('翻译内容是否需删除换行(1.是2.否):'))
 # urlname_t = urlname.replace('\\','\\\\')
 # print('转义后路径:',f'{urlname}//{docname}')
 path = f'.\\{docname}' #文件路径
 expath = '.\\漏洞库.xlsx'
 doc = docx.Document(path)
 tables = doc.tables # 获取文件中的表格集
 e1 = time.time()
 print(f'共{len(tables)}个表格')
 n = 1
 try:
 for i in range(0,len(tables)):
 table = tables[i]
 mydoc(doc,table,huan,expath)
 print(f'\n剩余{len(tables)-n}个表格待翻译')
 time.sleep(0.3)
 n += 1
 doc.save(f".\\trans{docname}")
 except Exception as e:
 print('报错:',e)
 e2 = time.time()
 print('耗时:',float(e2 - e1))
 print('转换完毕')
 system('pause')

mymain()

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

推荐阅读

程序员
Jenkins Slave - 如何添加或更新环境变量

如何解决《JenkinsSlave-如何添加或更新环境变量》经验，为你挑选了0个好方法。 ... [详细]
程序员
为什么TimedRotatingFileHandler无法正常工作以及如何在日志行中解决此问题(轮换正在工作,但缺少日志行)

如何解决《为什么TimedRotatingFileHandler无法正常工作以及如何在日志行中解决此问题(轮换正在工作,但缺少日志行)》经验，为你挑选了1个好方法。 ... [详细]
程序员
Travis CI突然失败：找不到conda命令

如何解决《TravisCI突然失败：找不到conda命令》经验，为你挑选了1个好方法。 ... [详细]
程序员
将功能分为验证和实施？为什么？

如何解决《将功能分为验证和实施？为什么？》经验，为你挑选了2个好方法。 ... [详细]
程序员
在函数内部使用dplyr时出错

如何解决《在函数内部使用dplyr时出错》经验，为你挑选了2个好方法。 ... [详细]
程序员
Linux上的Swift 2.2,"使用未解析的标识符'退出'"

如何解决《Linux上的Swift2.2,"使用未解析的标识符'退出'"》经验，为你挑选了1个好方法。 ... [详细]
程序员
JavaScript - ForEach

如何解决《JavaScript-ForEach》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Storyboard中创建可重用的视图

如何解决《在Storyboard中创建可重用的视图》经验，为你挑选了1个好方法。 ... [详细]
程序员
Android:如何动态更改动画速度？

如何解决《Android:如何动态更改动画速度？》经验，为你挑选了1个好方法。 ... [详细]
程序员
随机矩阵的所有行的快速随机加权选择

如何解决《随机矩阵的所有行的快速随机加权选择》经验，为你挑选了1个好方法。 ... [详细]
程序员
找到nginx版本？

如何解决《找到nginx版本？》经验，为你挑选了3个好方法。 ... [详细]
程序员
寻找一种简单的方法来跳过刀片模板中未定义的变量

如何解决《寻找一种简单的方法来跳过刀片模板中未定义的变量》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何不在node.js中覆盖文件

如何解决《如何不在node.js中覆盖文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
绑定到UWP中的多个属性

如何解决《绑定到UWP中的多个属性》经验，为你挑选了0个好方法。 ... [详细]
程序员
Python itertools-takewhile():多个谓词

如何解决《Pythonitertools-takewhile():多个谓词》经验，为你挑选了1个好方法。 ... [详细]
程序员
R编程语法

如何解决《R编程语法》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何"使用Google验证您的客户端"？

如何解决《如何"使用Google验证您的客户端"？》经验，为你挑选了1个好方法。 ... [详细]
程序员
当你在中间排除一个数字时如何使用SQL的BETWEEN条件？

如何解决《当你在中间排除一个数字时如何使用SQL的BETWEEN条件？》经验，为你挑选了1个好方法。 ... [详细]
程序员
fwrite()期望参数1是资源,c://中给出的字符串

如何解决《fwrite()期望参数1是资源,c://中给出的字符串》经验，为你挑选了1个好方法。 ... [详细]
程序员
从WebView保存图像

如何解决《从WebView保存图像》经验，为你挑选了0个好方法。 ... [详细]

保佑欣疼你的芯疼

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章