e904b667c6
Build/Publish Develop Docs / deploy (push) Failing after 1s
PaddleOCR Code Style Check / check-code-style (push) Failing after 1s
PaddleOCR PR Tests GPU / detect-changes (push) Failing after 1s
PaddleOCR PR Tests / detect-changes (push) Failing after 1s
PaddleOCR PR Tests GPU / test-pr-gpu (push) Has been cancelled
PaddleOCR PR Tests / test-pr (push) Has been cancelled
PaddleOCR PR Tests GPU / test-pr-gpu-impl (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.13) (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.8) (push) Has been cancelled
PaddleOCR PR Tests / test-pr-python (3.9) (push) Has been cancelled
1.5 KiB
1.5 KiB
langchain-paddleocr
本 Python 包在 LangChain 生态系统中提供对 PaddleOCR 功能的访问。
快速安装
pip install langchain-paddleocr
基本用法
PaddleOCRVLLoader
PaddleOCRVLLoader 允许你:
- 使用百度 PaddleOCR-VL 系列模型(例如 PaddleOCR-VL、PaddleOCR-VL-1.5、PaddleOCR-VL-1.6)从 PDF 和图像文件中提取文本和版面布局信息
- 处理来自本地文件或远程 URL 的文档
PaddleOCRVLLoader 的基本用法如下:
from langchain_paddleocr import PaddleOCRVLLoader
from pydantic import SecretStr
loader = PaddleOCRVLLoader(
file_path="path/to/document.pdf",
base_url="your-api-endpoint",
model="PaddleOCR-VL-1.5",
access_token=SecretStr("your-access-token") # 如果使用环境变量 `PADDLEOCR_ACCESS_TOKEN`,则此项为可选
)
docs = loader.load()
for doc in docs[:2]:
print(f"Content: {doc.page_content[:200]}...")
print(f"Source: {doc.metadata['source']}")
print("---")
📖 文档
完整文档请参阅 LangChain 文档。