#29 feat(sgsc-文档切分模块-xth): 新增OCR引擎切换与性能优化功能

已合併
LingMin 2 周之前 將 1 次代碼提交從 CRBC-MaaS-Platform-Project/dev_sgsc_xth合併至 CRBC-MaaS-Platform-Project/dev
  • 新增OCR引擎切换功能:支持通过config.ini配置切换GLM-OCR和MinerU两种引擎,保持飞桨版面分析分流逻辑不变,单页处理模式保留页码信息
  • 优化图片缓存机制:版面分析阶段缓存table页JPEG图片,供OCR阶段直接复用,避免重复PDF渲染,统一DPI为200提升性能
  • 添加全文提取统计:记录并输出版面分析耗时、OCR总耗时、OCR平均耗时、总页数、OCR页数等关键性能指标
  • 兼容多种引擎命名:支持glm_ocr/glm-ocr/glmocr和mineru/mineru-ocr/mineru_ocr等多种配置写法,增强配置灵活性"
- 新增OCR引擎切换功能:支持通过config.ini配置切换GLM-OCR和MinerU两种引擎,保持飞桨版面分析分流逻辑不变,单页处理模式保留页码信息 - 优化图片缓存机制:版面分析阶段缓存table页JPEG图片,供OCR阶段直接复用,避免重复PDF渲染,统一DPI为200提升性能 - 添加全文提取统计:记录并输出版面分析耗时、OCR总耗时、OCR平均耗时、总页数、OCR页数等关键性能指标 - 兼容多种引擎命名:支持glm_ocr/glm-ocr/glmocr和mineru/mineru-ocr/mineru_ocr等多种配置写法,增强配置灵活性"
LingMin2 周之前 關閉
該合併請求已經成功合併!
登入 才能加入這對話。
未選擇里程碑
未指派成員
1 參與者
正在加載...
取消
保存
尚未有任何內容