全球 AI 聊天室 · 现在 16 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
18
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录18 个结果

GLM-OCR

zai-org
Not specified

GLM OCR 是一款基于 GLM 视觉能力构建的轻量化文字识别模型。不同于传统的 OCR 仅能输出纯文本,它更像是一个能“读懂”图片的 AI,能够精准处理复杂排版、表格以及手写文字,并将识别结果直接转化为结构化文本。对于开发者而言,它极大地简化了从图像到数据的预处理流程,无需再编写复杂的后处理逻辑来修正识别错误。无论你是想快速数字化文档,还是构建自动化数据抓取工具,它都提供了极低的上门门槛,是替代传统 OCR 引擎的理想选择。

image to textmit
2.1K 星标查看详情

blip-image-captioning-large

Salesforce
Not specified

BLIP Image Captioning Large 是由 Salesforce 开发的一款成熟图像描述模型。它擅长将视觉信息转化为自然语言,能准确地为图片生成简洁、客观的文字描述。对于开发者而言,它非常适合用于构建自动化图库标签、为视障人士提供图像辅助描述,或作为多模态流水线中的预处理环节。该模型上手难度低,推理速度快,相比于参数量巨大的通用多模态大模型,它在特定描述任务上更高效且资源占用更少,是实现“图片转文字”功能的实用选择。

image to textbsd-3-clause
1.5K 星标查看详情

vit-gpt2-image-captioning

nlpconnect
Not specified

vit-gpt2-image-captioning 是一款经典的“看图说话”模型,它巧妙地结合了 Vision Transformer (ViT) 的视觉感知能力与 GPT-2 的文本生成能力。简单来说,它能像人类一样“读懂”图片内容,并自动生成一段通顺的文字描述。对于开发者而言,这款模型非常轻量化,上手难度极低,通过 Hugging Face 的 Transformers 库几行代码就能跑通。它非常适合用于构建自动化图片标签系统、辅助视障人士理解图像内容,或者为大规模图库建立文本索引。虽然它在处理极其复杂的逻辑细节时可能不如超大规模多模态模型,但在资源受限或追求推理速度的轻量级应用场景中,它是一个非常平衡且实用的选择。

image to textapache-2.0
935 星标查看详情

blip-image-captioning-base

Salesforce
Not specified

BLIP Image Captioning Base 是由 Salesforce 开发的一款经典视觉-语言预训练模型,专注于将图像内容转化为精准的文字描述。与复杂的通用大模型不同,它是一个轻量级的专项工具,能够快速识别图片中的主体对象及其关系,并生成简洁的自然语言标题。对于中国开发者而言,它非常适合集成到自动化打标签、电商商品描述生成或视障辅助工具等实际场景中。由于其参数规模适中,在普通消费级 GPU 甚至 CPU 上即可流畅运行,上手门槛极低,是构建图像理解管线的理想基础组件。

image to textbsd-3-clause
889 星标查看详情

trocr-base-handwritten

microsoft
Not specified

TrOCR base handwritten 是微软推出的端到端光学字符识别(OCR)模型,专门针对手写文本识别进行了优化。与传统 OCR 先分割字符再识别的方案不同,它采用了 Transformer 架构,直接将图像序列映射为文本,极大地提升了对潦草手写体和不规则排版的识别精度。对于开发者而言,该模型上手门槛较低,可通过 Hugging Face 等平台快速部署,非常适合用于数字化手写笔记、表单自动录入等需要高鲁棒性文本提取的场景,是构建垂直领域 OCR 应用的理想基础模型。

image to textmit
519 星标查看详情

NuMarkdown-8B-Thinking

numind
Not specified

NuMarkdown 8B Thinking 是一款专注于将图像高效转化为 Markdown 格式的轻量化视觉模型。它在 OCR 识别的基础上引入了“思考”机制,能更精准地解析复杂的文档布局、表格和数学公式,避免了传统 OCR 常见的乱码或格式错位问题。对于开发者而言,它非常适合用于构建自动化文档数字化管线,或作为 RAG 系统的预处理组件,将扫描件、截图快速转换为可编辑、可检索的结构化文本。由于参数量适中,其部署成本低且响应迅速,是替代昂贵闭源视觉模型的高性价比方案。

image to textmit
496 星标查看详情

NuExtract3

numind
Not specified

NuExtract3 是一款由 numind 推出的专业信息提取模型,专注于将非结构化文本或图像内容精准转化为结构化数据。与通用大模型不同,它更像是一个高效的“数据清洗专家”,能够严格按照用户定义的 Schema 提取关键字段,极大地降低了由于模型“幻觉”导致的格式错误。对于需要处理大量票据、表单或文档数字化、且对输出格式要求严苛的开发者来说,它是构建自动化数据 pipeline 的理想选择,上手难度低,可直接替代复杂的正则匹配或昂贵的通用 API 提取流程。

image to textapache-2.0
349 星标查看详情

LightOnOCR-1B-1025

lightonai
Not specified

LightOnOCR-1B-1025 是 LightOn 开源的轻量级视觉语言模型,主打图文识别与理解,参数量 1B 级别,部署门槛低,适合在消费级显存或边缘设备上跑通推理。模型基于 Apache-2.0 协议发布,商用友好,配合 Hugging Face Transformers 库几行代码即可接入,适配 `AutoModelForCausalLM` 与 `AutoProcessor` 标准流程。典型场景包括单据结构化、表格/表单抽取、中英混排文档数字化等,对版面复杂、字号较小的中文场景有一定鲁棒性。受限于参数量,长文档推理、复杂推理链条表现不如 7B 以上大模型,建议作为 OCR 后处理或轻量端侧落地的首选基座,配合规则引擎或 RAG 做二次清洗效果更佳。

image to textapache-2.0
256 星标查看详情

trocr-base-printed

microsoft
Not specified

TrOCR base printed 是由微软推出的端到端光学字符识别(OCR)模型。与传统 OCR 先检测文本行再识别字符的方案不同,它采用了 Transformer 架构,直接将图像特征转换为文本序列,能够更自然地处理打印体文字。该模型在处理清晰的文档扫描件、数字化表单时表现稳健,且由于采用了开源的 Apache-2.0 协议,开发者可以非常方便地将其集成到自己的本地化工作流中。对于习惯使用 Tesseract 或 PaddleOCR 的用户来说,TrOCR 提供了另一种基于深度学习的替代方案,尤其在识别精度和上下文理解上具有优势。

image to textSee model card
220 星标查看详情

nougat-base

facebook
Not specified

Nougat-base 是由 Meta (Facebook) 开发的一款专注于“图像转文本”的学术型视觉模型。它与传统的 OCR 工具不同,核心优势在于能够直接理解并还原复杂的学术文档结构。如果你手里有大量包含数学公式、表格、多级标题的 PDF 论文或扫描件,需要将其转化为高质量的 Markdown 格式,Nougat 是目前非常硬核的选择。它能跳过繁琐的布局分析,直接输出结构化的文本,极大降低了论文数字化处理的难度。不过需要注意的是,作为 base 版本,它对超长文档或极度模糊的图像处理能力有限,建议配合 Transformers 库使用,适合对文档还原精度有较高要求的科研或数据整理场景。

image to textcc-by-nc-4.0
189 星标查看详情

kosmos-2-patch14-224

microsoft
Not specified

Kosmos-2 是微软推出的多模态模型,专注于图像到文本的理解与生成。它通过独特的 Patch 机制将视觉信息转化为类似 Token 的形式,实现了图像与文本在同一个语义空间中的统一处理。对于开发者而言,它不仅能完成基础的图像描述,在视觉问答(VQA)和复杂场景分析上也有不错表现。由于采用 MIT 协议且结构清晰,它非常适合作为构建自定义多模态应用的基座模型,上手难度中等,是研究视觉语言模型(VLM)落地的一个极佳切入点。

image to textmit
183 星标查看详情

manga-ocr-base

kha-white
Not specified

manga ocr base 是一款专为漫画场景优化的图像文字识别模型。不同于通用 OCR 难以处理漫画中垂直排版、艺术字体或复杂背景的问题,该模型针对日漫等特定排版进行了深度优化,能更精准地提取对话框中的文本。对于想要搭建自动化翻译工作流、制作漫画数据库或进行本地化翻译的开发者来说,它是一个极佳的底层组件。上手难度较低,可直接集成到图像处理 pipeline 中,配合翻译 API 即可实现从图片到文本的快速转化。

image to textapache-2.0
180 星标查看详情

trocr-large-handwritten

microsoft
Not specified

TrOCR Large Handwritten 是由微软推出的端到端手写文本识别模型。与传统的 OCR 流程(先检测文字区域再识别)不同,它采用了 Transformer 架构,直接将图像像素映射为文本序列,极大地提升了对潦草手写体和复杂排版的鲁棒性。对于需要处理数字化笔记、古籍扫描或手写单据的开发者来说,这是一个高性能的开源选择。它不需要复杂的预处理,上手难度较低,可作为 Tesseract 等传统工具的升级替代方案,尤其在追求识别准确率的场景下表现出色。

image to textSee model card
166 星标查看详情

granite-vision-3.3-2b

ibm-granite
Not specified

Granite Vision 3.3 2B 是 IBM 推出的轻量级多模态视觉模型。它主打在极小参数量下实现高效的图像理解能力,非常适合那些对端侧部署或推理成本敏感的开发者。该模型能够将视觉信息转化为精准的文本描述,在文档分析、简单的图像识别和视觉问答场景中表现稳健。对于习惯使用大模型的用户来说,它更像是一个灵活的“视觉插件”,可以快速集成到自动化工作流中,且得益于 Apache-2.0 协议,企业级部署的门槛极低。

image to textapache-2.0
88 星标查看详情

PP-OCRv5_server_det

PaddlePaddle
Not specified

PP OCRv5 server det 是百度飞桨(PaddlePaddle)推出的最新版文字检测模型。作为工业级 OCR 链路的“眼睛”,它专注于在图像中精准定位文字区域,而非识别具体字符。相比轻量化版本,server 版在处理复杂背景、倾斜文本或超长文档时具有更高的鲁棒性和精度。对于开发者而言,它通常作为 OCR 预处理的第一步,配合识别模型使用。由于基于 PaddlePaddle 框架,它在国产硬件和服务器端部署有天然优势,上手难度中等,适合需要高精度文档数字化或自动化表单分析的场景。

image to textapache-2.0
75 星标查看详情

trocr-small-handwritten

microsoft
Not specified

TrOCR-small-handwritten 是微软推出的轻量级光学字符识别(OCR)模型,专门针对手写文本识别进行了优化。它摒弃了传统的 OCR 管道,采用 Transformer 架构直接将图像转化为文本,能有效处理书写风格多样、笔迹不规整的场景。由于参数量较小,该模型在保证识别精度的同时,具备极高的推理速度,非常适合部署在资源受限的边缘设备或需要实时响应的端侧应用中。对于开发者来说,它是一个低门槛的替代方案,可快速集成到笔记数字化或表单自动识别等工作流中。

image to textSee model card
67 星标查看详情

mgp-str-base

alibaba-damo
Not specified

mgp-str-base 是由阿里巴巴达摩院推出的图像转文本(Image-to-Text)基础模型。简单来说,它就像是给 AI 装上了“眼睛”,能够理解图片内容并将其转化为精准的文字描述。对于开发者而言,该模型原生适配 Hugging Face 的 transformers 库,这意味着如果你已经在用主流的深度学习框架,上手几乎没有门槛。它非常适合集成到需要自动化图像标注、视觉问答或图片内容理解的业务流程中。虽然目前官方未透露具体参数量,但作为 base 版本,它在性能与推理成本之间取得了较好的平衡,是构建轻量化视觉感知应用的一个扎实起点。

image to textSee model card
65 星标查看详情

pix2text-mfr

breezedeus
Not specified

pix2text-mfr 是一款专注于数学公式与文本识别的开源 OCR 工具。与通用 OCR 不同,它专门针对学术论文、教材等复杂排版场景进行了优化,能够精准地将图片中的数学公式转换为 LaTeX 格式,并同步还原正文文本。对于需要将纸质资料数字化、快速整理学术笔记的开发者和科研人员来说,它提供了一种轻量级且高效的替代方案,上手难度低,且能很好地弥补传统 OCR 在处理复杂数学符号时的缺失。

image to textmit
58 星标查看详情