Qwen3 VL 8B Instruct is a versatile vision-language model designed for developers needing efficient, high-performance mu...
Qwen
image-text-to-text
7.1M
378
Qwen2.5 VL 7B Instruct is a versatile vision-language model designed for high-precision image and video understanding. U...
Qwen
image-text-to-text
5.1M
438
GLM OCR is a specialized vision-language model designed to bridge the gap between raw image data and structured text. Un...
zai-org
image-text-to-text
3.2M
0
Unlimited OCR is a specialized image-to-text model designed for high-accuracy character recognition across diverse visua...
baidu
image-text-to-text
3.1M
0
Qwen3.6 27B Fable Fusion is a specialized large language model designed for developers who need high-parameter reasoning...
DavidAU
image-text-to-text
3.0M
0
Qwen3.5 9B is a versatile multimodal model designed to bridge the gap between lightweight efficiency and high-reasoning ...
Qwen
image-text-to-text
2.6M
192
Qwen3.5 4B is a compact multimodal model designed for efficient image-and-text processing. Unlike larger LLMs that requi...
Qwen
image-text-to-text
1.9M
110
Qwen2.5 VL 3B Instruct is a lightweight yet powerful vision-language model designed for efficient multimodal processing....
Qwen
image-text-to-text
1.8M
149
Gemma 4 26B A4B is a multimodal model from Google, designed for developers needing high-performance image-to-text and te...
google
image-text-to-text
1.6M
34
Gemma 4 31B IT is a mid-sized, instruction-tuned multimodal model designed for developers who need a balance between hig...
google
image-text-to-text
1.3M
88
Qwen3.6 27B is a multimodal model designed to bridge the gap between high-performance reasoning and efficient deployment...
Qwen
image-text-to-text
1.3M
189
Qwen3.6 35B A3B FP8 is a multimodal model designed for efficient image-text processing. By utilizing FP8 quantization, i...
Qwen
image-text-to-text
1.2M
80
Qwen3.6 27B FP8 is a high-efficiency multimodal model designed for developers who need a balance between reasoning depth...
Qwen
image-text-to-text
1.2M
91
Qwen3 VL 4B Instruct is a compact yet powerful vision-language model designed for efficient multimodal processing. Unlik...
Qwen
image-text-to-text
1.2M
119
Qwen3.5 2B is a compact, multimodal model designed for high-efficiency deployment in edge computing and resource-constra...
Qwen
image-text-to-text
1.1M
43
Qwen3.6 35B A3B is a multimodal model designed for efficient image-text processing, balancing high-parameter intelligenc...
Qwen
image-text-to-text
558.5K
191
Qwen3.6 27B AWQ INT4 is a quantized multimodal model designed for developers needing a high-performance balance between ...
cyankiwi
image-text-to-text
161.9K
40
Qwen3.6 27B NVFP4 is a high-efficiency multimodal model optimized for developers who need a balance between reasoning po...
unsloth
image-text-to-text
35.4K
24