模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

ms eff gcvit deepfake b0 kodf

mit
这是一个基于 GCViT 架构的轻量级视频分类模型,专门用于 Deepfake(深度伪造)检测。它由 KoreaPeter 提供,采用 B0 规模的参数设计,旨在兼顾识别精度与推理速度。对于开发者而言,该模型适合集成到视频审核流水线或安全验...
KoreaPeter 视频理解
17.6K 0

ms eff gcvit deepfake b5 kodf

mit
这是一个由 KoreaPeter 提供的视频分类模型,基于微软的 GCViT 架构并针对 Deepfake(深度伪造)检测进行了深度优化。该模型专注于识别视频中的面部篡改痕迹,能够有效区分真实拍摄与 AI 生成的虚假视频。对于需要构建内容审...
KoreaPeter 视频理解
16.3K 0

ms eff gcvit deepfake b0 ff plus plus

mit
这是一个基于 GCViT 架构的轻量化视频分类模型,专门用于 Deepfake(深度伪造)检测。它通过高效的视觉 Transformer 机制捕捉视频帧间的细微异常,旨在识别 AI 换脸或篡改的痕迹。对于开发者而言,该模型在保持低计算开销的...
KoreaPeter 视频理解
13.7K 0

ms eff gcvit deepfake b0 celeb df v2

mit
这是一个基于微软 GCViT 架构的轻量级深度伪造(Deepfake)检测模型,专门针对 Celeb-DF v2 数据集进行了优化。它属于视频分类模型,核心能力在于识别视频中人脸是否经过 AI 篡改。对于开发者而言,该模型 B0 版本参数量...
KoreaPeter 视频理解
13.4K 0

ms eff gcvit deepfake b5 celeb df v2

mit
这是一个基于微软 GCViT 架构的深度伪造(Deepfake)检测模型,专门针对 Celeb-DF v2 数据集进行了优化。它能够通过分析视频帧中的细微异常,识别出由 AI 生成或篡改的人脸视频。对于需要构建自动化内容审核系统、验证视频真...
KoreaPeter 视频理解
13.4K 0

ms eff gcvit deepfake b5 ff plus plus

mit
这是一个基于 GCViT 架构的高性能 Deepfake 检测模型,专门用于识别视频中的人脸伪造与篡改。它在处理视频分类任务时具有极强的特征提取能力,能够捕捉到深度伪造视频中细微的伪影和不自然之处。对于需要构建反欺诈系统、身份验证或内容审核...
KoreaPeter 视频理解
10.5K 0

vjepa2 vitl fpc64 256

mit
V-JEPA 是 Meta 推出的一款基于自监督学习的视频表征模型。不同之于传统的逐帧分析,它旨在学习视频中的空间-时间预测,能够更高效地捕捉动作逻辑和场景变化。该版本采用 ViT-L 骨干网络,特别强化了特征提取能力,非常适合需要处理复杂...
facebook 视频理解
792 1

vivit b 16x2 kinetics400

mit
ViViT-B/16x2 是 Google 推出的基于 Transformer 的视频分类模型,旨在将 Vision Transformer (ViT) 的强大表征能力迁移到视频领域。该模型通过对视频帧进行时空切片处理,能够有效捕捉视频中的...
google 视频理解
448 0

vivit b 16x2

mit
ViViT-B/16x2 是 Google 推出的一款基于 Transformer 架构的视频分类模型。它将视频帧视为 3D 图像块(Tubelets),通过时空注意力机制高效捕捉视频中的动态特征。相比于传统的 2D CNN 叠加 LSTM...
google 视频理解
423 0

vjepa2 vitg fpc64 256

apache-2.0
V-JEPA 是 Meta 推出的一款基于联合嵌入预测架构(JEPA)的视频预训练模型。与传统的生成式模型不同,它通过预测视频掩码部分的潜在表示来学习世界模型,从而在不依赖海量标签的情况下高效理解视频中的动态语义。该版本采用了 ViT-g ...
facebook 视频理解
398 0

xclip base patch32

mit
xclip base patch32 是由微软推出的轻量级视频-语言预训练模型,旨在解决视频内容理解中的跨模态对齐问题。与传统的图像 CLIP 不同,它能捕捉视频中的时空动态特征,使机器能够通过文本描述检索视频片段或对视频内容进行分类。对于...
microsoft 视频理解
363 0

vjepa2 vitl fpc16 256 ssv2

mit
V-JEPA 是 Meta 推出的一款基于联合嵌入预测架构的视频表征模型。与传统的生成式模型不同,它通过预测缺失的视频块来学习视频的语义特征,而非重建像素,这使其在处理复杂视频场景时具有极高的效率。该版本采用了 ViT-L 骨干网络并在 S...
facebook 视频理解
325 0

xclip base patch32 16 frames

mit
xclip base patch32 是由微软推出的视频-文本对齐模型,旨在将 CLIP 的强大视觉表征能力扩展到视频领域。它通过引入时空注意力机制,能够理解视频帧之间的动态关系,而非简单地将其视为单张图片的堆叠。对于开发者而言,该模型非常...
microsoft 视频理解
172 0