Qwen3-VL-8B-Instruct 是阿里巴巴 Qwen 团队推出的最新视觉语言模型,主打在轻量级参数下实现极强的图像理解力。它不仅能精准识别图片中的细粒度物体,在 OCR 文字识别、复杂图表分析以及视觉推理方面也达到了行业领先水平。...
Qwen
多模态对话
7.1M
378
Qwen2.5-VL-7B-Instruct 是阿里通义千问团队推出的新一代多模态视觉语言模型。相比前代,它在图像理解、文档解析和视频分析能力上有显著提升,尤其擅长处理高分辨率图片中的细节文字和复杂图表。对于开发者而言,它在保持 7B 参数...
Qwen
多模态对话
5.1M
438
GLM OCR 是一款基于 GLM 视觉能力构建的轻量化文字识别模型。不同于传统的 OCR 仅能输出纯文本,它更像是一个能“读懂”图片的 AI,能够精准处理复杂排版、表格以及手写文字,并将识别结果直接转化为结构化文本。对于开发者而言,它极大...
zai-org
多模态对话
3.2M
0
Unlimited OCR 是由百度推出的一款开源图像文本识别模型,旨在解决复杂场景下的文字提取痛点。不同于传统的 OCR 工具,它在处理非结构化排版、多语言混排以及低质量图像时具有更强的鲁棒性。对于开发者而言,由于采用了 MIT 许可,该...
baidu
多模态对话
3.1M
0
这是一个基于 Qwen 系列进行深度微调的社区量化版本,采用了 GGUF 格式,旨在通过多种融合技术提升模型的逻辑推理与创意表达能力。该模型在保持 Qwen 强大中文底座能力的同时,通过特定数据集的优化,弱化了原厂过于死板的回复限制,使对话...
DavidAU
多模态对话
3.0M
0
Qwen3.5 9B 是阿里通义千问家族的最新轻量化多模态模型。它在保持 9B 参数规模的同时,显著增强了对图像和文本的综合理解能力。对于中国开发者而言,该模型最大的优势在于其极高的推理能效比,能够轻松部署在消费级显卡上,同时在中文语境的视...
Qwen
多模态对话
2.6M
192
Qwen3.5 4B 是一款兼顾轻量化与多模态能力的视觉语言模型。它在保持 4B 小参数规模的同时,实现了高效的图文理解能力,能够精准分析图像内容并结合文本指令进行推理。对于开发者而言,该模型极大地降低了部署门槛,非常适合集成在端侧设备或资...
Qwen
多模态对话
1.9M
110
Qwen2.5 VL 3B Instruct 是阿里通义千问推出的轻量级视觉语言模型。它在极小的参数规模下,实现了极强的图像理解和多模态推理能力,能够精准识别图片中的细节并进行复杂的文本分析。对于开发者而言,3B 的尺寸意味着它对显存极其友...
Qwen
多模态对话
1.8M
149
Gemma 4 26B A4B it 是 Google 推出的最新开源多模态模型,主打高效能与强推理。它打破了纯文本限制,能够直接理解图像输入并输出高质量文本,非常适合需要视觉分析、文档解析或图文问答的开发者。相比于闭源的 Gemini,该...
google
多模态对话
1.6M
34
Gemma 4 31B-it 是 Google 推出的一款高性能开源多模态模型。它在保持中等参数规模的同时,显著增强了对图像和文本的综合理解能力,能够高效处理复杂的图文分析任务。对于中国开发者而言,该模型采用 Apache-2.0 协议,部...
google
多模态对话
1.3M
88
Qwen3.6-27B 是阿里通义千问团队推出的一个平衡性能与规模的视觉语言模型。它采用了 image-text-to-text 架构,能够高效处理图文混合输入,在 OCR 文字识别、复杂图表分析以及视觉常识推理方面表现出色。对于开发者而言...
Qwen
多模态对话
1.3M
189
Qwen3.6 35B A3B FP8 是一款基于混合专家架构(MoE)的多模态模型,旨在平衡推理成本与理解能力。它支持图像与文本的混合输入,能够高效处理复杂的视觉分析任务。通过 FP8 量化,该模型在大幅降低显存占用和提升推理速度的同时,...
Qwen
多模态对话
1.2M
80
Qwen3.6-27B-FP8 是阿里通义千问系列的一款高性能多模态模型。它在保持 27B 参数量级强悍理解力的同时,通过 FP8 量化技术大幅降低了显存占用,让开发者在消费级显卡上也能流畅运行。该模型支持图文输入,能够精准识别图像细节并结...
Qwen
多模态对话
1.2M
91
Qwen3-VL-4B-Instruct 是阿里巴巴通义千问团队推出的轻量化多模态大模型。它在保持较小参数规模的同时,显著增强了对图像内容的理解与分析能力。对于开发者而言,这款模型在 OCR 文字识别、图表解析以及复杂视觉推理方面表现出色,...
Qwen
多模态对话
1.2M
119
Qwen3.5 2B 是一款轻量级但能力强悍的多模态模型,主打在端侧设备实现高效的图文理解。它不仅能处理纯文本任务,还能精准识别并分析图像内容,将视觉感知与语言生成深度结合。对于开发者而言,2B 的参数规模意味着极低的部署门槛和推理成本,非...
Qwen
多模态对话
1.1M
43
Qwen3.6 35B A3B 是阿里 Qwen 团队推出的一款高性能多模态模型,主打图文理解与生成。它在保持 35B 参数量级带来的强大推理能力的同时,通过 A3B 架构优化了计算效率,使得在处理复杂视觉任务(如文档分析、图表解读)时响应...
Qwen
多模态对话
558.5K
191
Qwen3.6-27B-AWQ-INT4 是阿里通义千问系列的一个量化版本,采用了 AWQ 4-bit 量化技术,在保持 27B 模型强大理解与生成能力的同时,大幅降低了显存占用。该模型支持图文多模态输入,能够高效处理图像分析与文本生成任务...
cyankiwi
多模态对话
161.9K
40
Qwen3.6-27B-NVFP4 是基于阿里通义千问最新系列的量化版本,由 Unsloth 团队优化。该模型主打多模态理解,能够高效处理图文输入。得益于 NVFP4 量化技术,它在大幅降低显存占用的同时,尽可能保留了 27B 参数规模的推...
unsloth
多模态对话
35.4K
24