PP-LCNet x1.0 是由百度 PaddlePaddle 团队开发的一款轻量级图像识别模型,核心设计目标是在保证精度的情况下极致压缩计算量。它采用了深度可分离卷积的优化结构,非常适合部署在手机、嵌入式设备等端侧场景。对于开发者而言,该...
PaddlePaddle
图像描述
650.0K
0
PP OCRv5 server det 是百度飞桨(PaddlePaddle)推出的最新版文字检测模型。作为工业级 OCR 链路的“眼睛”,它专注于在图像中精准定位文字区域,而非识别具体字符。相比轻量化版本,server 版在处理复杂背景、...
PaddlePaddle
图像描述
543.4K
5
manga ocr base 是一款专为漫画场景优化的图像文字识别模型。不同于通用 OCR 难以处理漫画中垂直排版、艺术字体或复杂背景的问题,该模型针对日漫等特定排版进行了深度优化,能更精准地提取对话框中的文本。对于想要搭建自动化翻译工作流...
kha-white
图像描述
520.4K
0
pix2text-mfr 是一款专注于数学公式与文本识别的开源 OCR 工具。与通用 OCR 不同,它专门针对学术论文、教材等复杂排版场景进行了优化,能够精准地将图片中的数学公式转换为 LaTeX 格式,并同步还原正文文本。对于需要将纸质资...
breezedeus
图像描述
417.4K
0
UVDoc 是由百度飞桨(PaddlePaddle)推出的文档图像理解模型,专注于将复杂的文档图片转化为结构化文本。它不同于简单的 OCR 文字识别,而是能够更好地理解文档的版式布局,尤其擅长处理包含表格、标题和正文的扫描件或照片。对于中国...
PaddlePaddle
图像描述
408.2K
1
PP OCRv5 server rec 是百度飞桨(PaddlePaddle)推出的最新一代文字识别(Recognition)服务端模型。相比于轻量化版本,server 版在识别精度上做了深度优化,尤其擅长处理复杂背景、低分辨率或形变严重的...
PaddlePaddle
图像描述
365.3K
3
Qwen3-VL-8B-Instruct-NVFP4 是阿里通义千问最新视觉语言模型的量化版本。该模型主打多模态理解,能够精准识别图像中的细节、阅读复杂图表并进行逻辑推理。由于采用了 NVFP4 量化技术,它在保持强大视觉分析能力的同时,大...
JEILDLWLRMA
图像描述
289.4K
0
PP-OCRv5 mobile rec 是百度飞桨(PaddlePaddle)推出的轻量化文本识别模型,专门针对移动端和边缘设备优化。它在保持高识别精度的同时,极大地降低了推理延迟和内存占用,非常适合集成到手机 App 或嵌入式设备中。对于...
PaddlePaddle
图像描述
34.2K
1
NuExtract3 是一款由 numind 推出的专业信息提取模型,专注于将非结构化文本或图像内容精准转化为结构化数据。与通用大模型不同,它更像是一个高效的“数据清洗专家”,能够严格按照用户定义的 Schema 提取关键字段,极大地降低了...
numind
图像描述
14.5K
2
BLIP Image Captioning Base 是由 Salesforce 开发的一款经典视觉-语言预训练模型,专注于将图像内容转化为精准的文字描述。与复杂的通用大模型不同,它是一个轻量级的专项工具,能够快速识别图片中的主体对象及其关...
Salesforce
图像描述
3.8K
2
BLIP Image Captioning Large 是由 Salesforce 开发的一款成熟图像描述模型。它擅长将视觉信息转化为自然语言,能准确地为图片生成简洁、客观的文字描述。对于开发者而言,它非常适合用于构建自动化图库标签、为视障...
Salesforce
图像描述
876
1
TrOCR base printed 是由微软推出的端到端光学字符识别(OCR)模型。与传统 OCR 先检测文本行再识别字符的方案不同,它采用了 Transformer 架构,直接将图像特征转换为文本序列,能够更自然地处理打印体文字。该模型...
microsoft
图像描述
412
0
Granite Vision 3.3 2B 是 IBM 推出的轻量级多模态视觉模型。它主打在极小参数量下实现高效的图像理解能力,非常适合那些对端侧部署或推理成本敏感的开发者。该模型能够将视觉信息转化为精准的文本描述,在文档分析、简单的图像识...
ibm-granite
图像描述
330
0
NuMarkdown 8B Thinking 是一款专注于将图像高效转化为 Markdown 格式的轻量化视觉模型。它在 OCR 识别的基础上引入了“思考”机制,能更精准地解析复杂的文档布局、表格和数学公式,避免了传统 OCR 常见的乱码或...
numind
图像描述
287
0
TrOCR base handwritten 是微软推出的端到端光学字符识别(OCR)模型,专门针对手写文本识别进行了优化。与传统 OCR 先分割字符再识别的方案不同,它采用了 Transformer 架构,直接将图像序列映射为文本,极大地...
microsoft
图像描述
276
1
TrOCR-small-handwritten 是微软推出的轻量级光学字符识别(OCR)模型,专门针对手写文本识别进行了优化。它摒弃了传统的 OCR 管道,采用 Transformer 架构直接将图像转化为文本,能有效处理书写风格多样、笔迹...
microsoft
图像描述
193
0
Kosmos-2 是微软推出的多模态模型,专注于图像到文本的理解与生成。它通过独特的 Patch 机制将视觉信息转化为类似 Token 的形式,实现了图像与文本在同一个语义空间中的统一处理。对于开发者而言,它不仅能完成基础的图像描述,在视觉...
microsoft
图像描述
190
0
TrOCR Large Handwritten 是由微软推出的端到端手写文本识别模型。与传统的 OCR 流程(先检测文字区域再识别)不同,它采用了 Transformer 架构,直接将图像像素映射为文本序列,极大地提升了对潦草手写体和复杂排...
microsoft
图像描述
186
0