MiniCPM-V 是由 OpenBMB 开发的一款高性能端侧多模态模型。它在轻量化和强能力之间取得了极佳平衡,不仅能精准理解图像细节,还支持高分辨率输入,在视觉问答和图像描述任务上表现出色。对于中国开发者而言,它的核心优势在于极低的部署门...
openbmb
视觉问答
89.4K
52
ViLT-B32-Finetuned-VQA 是一款基于视觉-语言 Transformer 架构的轻量化视觉问答模型。与传统的 VQA 模型不同,它舍弃了复杂的预训练目标检测网络,直接将图像和文本映射到统一的向量空间,从而显著提升了推理速度...
dandelin
视觉问答
74.8K
0
MiniCPM-V 2 是由 OpenBMB 团队打造的一款高性能端侧多模态模型。它在保持轻量级参数的同时,展现出了媲美 GPT-4V 的图像理解能力,特别是在高分辨率图像处理和细粒度视觉分析上表现出色。对于中国开发者而言,该模型最大的优势...
openbmb
视觉问答
22.0K
48
LLaVA-Med v1.5 是一款专门针对医疗影像分析微调的多模态大模型,基于 Mistral-7B 构建。它将视觉理解能力与医学专业知识结合,能够通过分析 X 光、CT 等医疗图像来回答复杂的医学问题。对于开发者而言,该模型在医疗 VQ...
chaoyinshe
视觉问答
3.4K
0
MiniCPM-V 2.6(此处对应 V 4.5 系列)是一款极其出色的端侧多模态模型,通过 GGUF 格式量化,让开发者能够在消费级硬件甚至手机上流畅运行。它在图像理解和视觉问答上表现强悍,能够精准识别图片细节并进行复杂推理,且对中文支持...
gaianet
视觉问答
2.5K
0
MiniCPM-V 2.6 (GGUF版) 是一款极具性价比的端侧多模态大模型。它最大的特点是在极小的参数规模下,实现了媲美 GPT-4V 的视觉理解能力,尤其擅长高分辨率图像分析和 OCR 文字识别。得益于 GGUF 格式,该模型通过 l...
second-state
视觉问答
2.2K
0
uAI NEXUS MedVLM 1.0a 7B RL 是一款专注于医疗视觉问答(VQA)的轻量化多模态模型。它在 7B 参数规模的基础上,通过强化学习(RL)优化,旨在提升医疗影像分析与专业医学文本理解的精准度。对于开发者而言,该模型适合...
UII-AI
视觉问答
2.0K
0
OpenCaption 4B 是一款专注于图像描述与视觉问答的轻量化多模态模型。该版本经过 SFT 微调并转换为 GGUF 格式,极大降低了部署门槛,使得开发者可以在消费级显卡甚至 CPU 环境下流畅运行。相比于通用大模型,它在图像细节捕捉...
mradermacher
视觉问答
1.5K
0
VideoLLaMA2.1 7B AV 是一款专注于视频理解与视觉问答的开源多模态模型。它通过增强的音视频对齐能力,能够像人类一样“观看”视频并理解其中的动态细节与音频信息,而非简单地处理单帧图片。对于开发者而言,该模型在视频摘要、内容分析...
DAMO-NLP-SG
视觉问答
1.1K
1
VideoLLaMA2.1 7B 16F Base 是一款专注于视频理解与问答的开源多模态模型。它通过增强的视觉编码能力,能够更精准地捕捉视频中的时空动态信息,而非简单地将视频视为一组静态图片的堆叠。对于开发者而言,该模型适合用于构建视频内...
DAMO-NLP-SG
视觉问答
990
0
DePlot 是 Google 推出的一款专注于“图表数字化”的视觉问答模型。它不直接回答问题,而是先将复杂的统计图表(如折线图、柱状图)精准地转化为结构化的表格数据,再基于数据进行推理。对于开发者来说,它解决了传统 OCR 难以处理图表坐...
google
视觉问答
572
0
pix2struct ai2d base 是一款由 Google 开发的视觉问答(VQA)模型,其核心能力在于将视觉图像(尤其是包含结构化信息的图表、文档)精准转化为可理解的文本描述。与通用多模态模型不同,它专注于解析图像中的空间结构和逻辑...
google
视觉问答
422
0
Qwen3.5 2B MedVL 是一款基于通义千问架构、专注于医疗视觉问答(VQA)的轻量级多模态模型。它通过在医学影像数据集上的深度微调,能够理解 X 光片、CT 等医学图像并回答相关专业问题。由于参数量仅 2B,该模型在保证医疗专业性...
OpenMed
视觉问答
388
3
BLIP VQA Base 是由 Salesforce 开发的一款经典视觉问答模型。它通过将视觉编码器与语言模型相结合,实现了对图像内容的深度理解与交互。与单纯的图像打标不同,该模型支持用户以自然语言对图片进行提问并获得精准回答。对于开发者...
Salesforce
视觉问答
308
0
BLIP VQA Capfilt Large 是由 Salesforce 开发的一款多模态模型,专注于视觉问答(VQA)和图像描述。它在理解图像内容与文本指令的对齐方面表现出色,能够精准地回答关于图片细节的问题。对于中国开发者而言,该模型非...
Salesforce
视觉问答
230
0
VideoScore2 是一款由 TIGER-Lab 推出的视频质量评估模型,旨在解决视频生成领域中“好坏难量化”的痛点。不同于传统的单一指标,它能像人类一样感知视频的视觉质量和时间连续性,为 AI 生成视频提供客观的打分参考。对于开发者而...
TIGER-Lab
视觉问答
223
0