admin管理员组

文章数量:1605159

1. 安装

1.1 安装PaddlePaddle

您的机器安装的是CUDA9或CUDA10,请运行以下命令安装

python3 -m pip install paddlepaddle-gpu -i https://mirror.baidu.com/pypi/simple

您的机器是CPU,请运行以下命令安装

python3 -m pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple

更多的版本需求,请参照飞桨官网安装文档中的说明进行操作。

1.2 安装PaddleOCR whl包
pip install “paddleocr>=2.0.1” # 推荐使用2.0.1+版本
对于Windows环境用户:直接通过pip安装的shapely库可能出现[winRrror 126] 找不到指定模块的问题。建议从这里下载shapely安装包完成安装。

2 下载代码

git clone https://github.com/PaddlePaddle/PaddleOCR.git

3. 两种方式实现pdf to word

3.1 使用提供的代码实现转换

1.使用这个网站PDF转化 将pdf文件 拆分成若干个单个pdf页

运行这个python文件

python ppstructure/pdf2word/pdf2word.py

2.得到输入的word文档 使用一下代码将多个word文档 合成一个word文档

import os
from docx import Document

def merge_docx_from_folder(folder_path, output_file):
    # 创建一个空白的目标文档
    merged_doc = Document()

    # 遍历指定文件夹中的所有文件
    for filename in os.listdir(folder_path):
        if filename.endswith(".docx"):
            # 构造完整的文件路径
            file_path = os.path.join(folder_path, filename)

            # 打开当前的 Word 文件
            doc = Document(file_path)

            # 遍历当前 Word 文件的每个段落,并逐段复制到目标文档
            for para in doc.paragraphs:
                merged_doc.add_paragraph(para.text)

            # 添加分页符,区分不同文件的内容
            merged_doc.add_page_break()

    # 保存合并后的文档
    merged_doc.save(output_file)

# 指定要合并的文件夹路径和输出文件名
folder_path = r"E:\graduate\work\haohanshendu\work\code\ocr_for_transcribing_pdf_slides-main\input_images\output"
output_file = "merged_output.docx"

# 调用函数执行合并操作
merge_docx_from_folder(folder_path, output_file)

使用ppstructure/predict_system.py 自定义使用模型 进行转换

修改一下代码

在模型库1模型库2寻找模型地址



运行ppstructure/predict_system.py文件

本文标签: 操作指南OCRPaddlewordPDF