CLIP ViT-B/32 是 OpenAI 推出的经典多模态模型,其核心能力是将图像和文本映射到同一个向量空间。对于开发者来说,它不再是简单的图像分类器,而是一个强大的“语义匹配机”。你可以用它实现以文搜图、自动为图片打标签,或者将其作为...
openai
图文检索
21.0M
0
CLIP ViT-L/14 是 OpenAI 推出的经典多模态预训练模型,其核心能力在于将图像和文本映射到同一个特征空间。对于开发者而言,它不像生成式 AI 那样直接产出图片,而是一个极其强大的“语义对齐”工具。它能精准理解图片内容并将其转...
openai
图文检索
6.6M
0
CLIP ViT-L/14@336 是 OpenAI 推出的经典视觉-语言预训练模型。它通过海量图文对学习,将图像和文本映射到同一个向量空间,从而实现精准的跨模态检索。相比标准版,该模型将输入分辨率提升至 336x336,显著增强了对图像细...
openai
图文检索
3.7M
0
这是一个基于 CLIP 架构的视觉-语言预训练模型,由 LAION 社区在海量数据集上训练而成。它通过将图像和文本映射到同一个向量空间,实现了强大的跨模态检索能力。对于开发者来说,它不仅能用于精准的图文匹配,更是很多生成式 AI(如 Sta...
laion
图文检索
3.6M
0
Fashion CLIP 是一款专门针对时尚领域优化的图文检索模型。不同于通用 CLIP 模型,它在海量时尚数据集上进行了微调,能够更精准地理解服装的材质、款式和细分风格。对于开发者而言,它非常适合用于构建电商平台的“以图搜图”功能或精准的...
patrickjohncyh
图文检索
2.6M
0
这是一个基于 ConvNeXt 架构且在 LAION-2B 大规模数据集上预训练的 CLIP 视觉-语言模型。相比于主流的 ViT 架构,它采用了纯卷积网络来处理图像,在保持强大特征提取能力的同时,对不同分辨率的图像适配更灵活。该模型擅长将...
laion
图文检索
2.0M
0
CLIP ViT-B/16 是 OpenAI 推出的经典视觉-语言预训练模型,其核心能力在于将图像和文本映射到同一个语义向量空间。对于开发者而言,它不再是传统的图像分类器,而是一个强大的“语义对齐”工具。你可以用它实现无需标注数据的零样本分...
openai
图文检索
2.0M
0
Tiny CLIP Text 2 是一款轻量级的图像-文本检索模型,专注于将文本描述高效地转化为向量空间,以便与图像特征进行匹配。与参数量巨大的主流 CLIP 模型不同,它在保持核心语义对齐能力的同时,极大地降低了计算开销和内存占用。对于中...
peft-internal-testing
图文检索
1.9M
0
这是一个基于 ViT-L/14 架构并在海量 LAION-2B 数据集上精调的 CLIP 模型。它擅长将图像和文本映射到同一个向量空间,从而实现极高精度的图文匹配。对于开发者而言,它不是一个生成图像的工具,而是一个强大的“视觉理解”引擎。你...
laion
图文检索
597.3K
0
ImageTextRetrieval 是一款专注于图文跨模态检索的轻量化模型,旨在解决“用词找图”或“以图搜词”的实际需求。它不同于生成式 AI(如 Midjourney),而是通过将图像和文本映射到同一个向量空间,实现高效的语义匹配。对于...
ohgnues
图文检索
5
0