模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

layoutlm document qa

mit
LayoutLM Document QA 是一款专注于文档理解的 AI 模型,它打破了传统 OCR 仅识别文字的局限,能够同时分析文本内容、字体样式和页面布局(如表格、表单位置)。简单来说,它不仅能“读”到字,还能像人一样通过位置关系理解文...
impira 文档理解
192.9K 0

donut base finetuned docvqa

mit
Donut-base-finetuned-docvqa 是由 Naver Clova 开发的一款端到端文档问答模型。它最大的特点是抛弃了传统的 OCR 预处理步骤,直接通过视觉编码器理解文档图像并生成文本答案,有效解决了 OCR 识别错误导...
naver-clova-ix 文档理解
67.7K 0

tiny doc qa vision encoder decoder

mit
这是一个专注于文档问答(DocQA)的轻量级视觉编码-解码模型。与通用大模型不同,它专门针对文档图像的结构化理解进行了优化,能够精准识别图片中的文本位置并回答相关问题。由于模型规模较小,它非常适合部署在端侧设备或对推理延迟要求较高的业务场景...
fxmarty 文档理解
5.5K 0

donut base finetuned docvqa

Apache-2.0
Donut-base-finetuned-docvqa 是一款专注于文档问答(DocVQA)的轻量级 OCR-free 模型。与传统需要先跑 OCR 识别文字再交给 LLM 处理的流水线不同,它采用端到端架构,直接从图像像素中提取答案,极大...
Xenova 文档理解
1.6K 0

layoutlmv2 base uncased finetuned docvqa

cc-by-sa-4.0
这是一个基于 LayoutLMv2 预训练模型并针对 DocVQA(文档视觉问答)任务微调的轻量化版本。与纯文本模型不同,它能同时理解文档的文字内容、布局位置和视觉特征,非常适合处理发票、表单、报告等具有复杂排版结构的 PDF 或扫描件。对...
tiennvcs 文档理解
718 0

Llama 3.1 PersianQA

apache-2.0
Llama 3.1 PersianQA 是基于 Meta Llama 3.1 架构针对波斯语问答场景优化的专项模型。它专注于文档问答(DocQA)任务,能够高效地从波斯语文本中提取关键信息并给出精准回答。对于需要处理中东地区语言数据的开发者...
zpm 文档理解
475 0

layoutlmv3 docvqa t11c5000

Apache-2.0
LayoutLMv3 是目前文档理解领域的主流基座模型,该版本专门针对 DocVQA(文档视觉问答)任务进行了优化。与纯文本 LLM 不同,它能同时处理文本内容、布局位置和图像视觉信息,能够精准地在票据、表单或报告等复杂排版文档中定位答案。...
xhyi 文档理解
168 0

bart qg finetune squad

apache-2.0
这是一个基于 BART 模型并在 SQuAD 数据集上进行微调的问答生成模型,专门用于从给定文档中自动提取并生成问题(Question Generation)。与传统的阅读理解模型(回答问题)相反,它擅长将长文本转化为高质量的问答对。对于中...
mghan3624 文档理解
89 0

OCR DocVQA Donut

mit
Donut 是一款打破传统 OCR 流程的文档问答模型。与传统的“先识别文字、再分析结构、最后提取信息”的三步走方案不同,它采用端到端的视觉编码架构,直接从文档图像中读取语义并生成答案。这意味着它不需要依赖外部 OCR 引擎,极大降低了部署...
jinhybr 文档理解
72 0

glm 4vq

Apache-2.0
GLM-4VQ 是一款专注于文档问答(DocQA)的轻量化模型。它针对长文本理解和精准信息提取进行了优化,能够快速在海量文档中定位关键答案,有效降低了传统 RAG 流程中常见的信息丢失问题。对于开发者而言,该模型上手门槛低,非常适合集成到企...
nikravan 文档理解
54 0

tiny doc qa vision encoder decoder

mit
这是一个轻量级的文档问答(DocQA)视觉编码器-解码器模型,专门为处理文档图像并从中提取答案而设计。它采用了典型的视觉-语言架构,能够识别文档中的文字布局与语义关系,将图像信息转化为可理解的文本回答。由于其轻量化特性,该模型非常适合部署在...
optimum-intel-internal-testing 文档理解
44 0

VieTable donut docvqa demo

mit
VieTable donut docvqa demo 是一个基于 Donut 架构的文档视觉问答(DocVQA)演示模型。与传统的 OCR+NLP 串联方案不同,它采用端到端的视觉解析方式,直接从文档图像中提取信息并回答问题,避免了 OCR...
YuukiAsuna 文档理解
34 0