Files
wehub-resource-sync e904b667c6
Build/Publish Develop Docs / deploy (push) Failing after 1s
PaddleOCR Code Style Check / check-code-style (push) Failing after 1s
PaddleOCR PR Tests GPU / detect-changes (push) Failing after 1s
PaddleOCR PR Tests / detect-changes (push) Failing after 1s
PaddleOCR PR Tests GPU / test-pr-gpu (push) Has been cancelled
PaddleOCR PR Tests / test-pr (push) Has been cancelled
PaddleOCR PR Tests GPU / test-pr-gpu-impl (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.13) (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.8) (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.9) (push) Has been cancelled
chore: import upstream snapshot with attribution
2026-07-13 11:59:26 +08:00

1.5 KiB

langchain-paddleocr

PyPI - 版本 PyPI - 许可证 PyPI - 下载量

本 Python 包在 LangChain 生态系统中提供对 PaddleOCR 功能的访问。

快速安装

pip install langchain-paddleocr

基本用法

PaddleOCRVLLoader

PaddleOCRVLLoader 允许你:

  • 使用百度 PaddleOCR-VL 系列模型(例如 PaddleOCR-VL、PaddleOCR-VL-1.5、PaddleOCR-VL-1.6)从 PDF 和图像文件中提取文本和版面布局信息
  • 处理来自本地文件或远程 URL 的文档

PaddleOCRVLLoader 的基本用法如下:

from langchain_paddleocr import PaddleOCRVLLoader
from pydantic import SecretStr

loader = PaddleOCRVLLoader(
    file_path="path/to/document.pdf",
    base_url="your-api-endpoint",
    model="PaddleOCR-VL-1.5",
    access_token=SecretStr("your-access-token")  # 如果使用环境变量 `PADDLEOCR_ACCESS_TOKEN`,则此项为可选
)

docs = loader.load()

for doc in docs[:2]:
    print(f"Content: {doc.page_content[:200]}...")
    print(f"Source: {doc.metadata['source']}")
    print("---")

📖 文档

完整文档请参阅 LangChain 文档