AI 工具合集
一站式收录 AI 模型、AI 技能与 MCP 工具,搜索匹配你喜欢的 AI。
AI 模型 · 语音降噪
查看全部 (20)sepformer wham16k enhancement
AI 模型SepFormer WHAM16k 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的环境背景中提取纯净的人声。它采用了先进的 Transformer 架构来处理时间-频率域的信号,能够有效抑制复杂
sepformer dns4 16k enhancement
AI 模型SepFormer DNS4 16k 是一款由 SpeechBrain 提供的专业语音增强模型,专门用于从嘈杂的音频中分离并提取纯净的人声。它针对 16kHz 采样率进行了优化,能够有效抑制背景噪音和环境干扰。对于开发者
sepformer whamr enhancement
AI 模型SepFormer WHAMR 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的背景环境中提取纯净的人声。它采用了先进的 Transformer 架构来处理频谱分离,特别擅长处理复杂的真实场景噪声
sepformer wham enhancement
AI 模型SepFormer WHAM Enhancement 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的背景中提取清晰的人声。它采用了先进的 SepFormer 架构,能够有效处理复杂的真实场景噪声
speech enhancement sgmse
AI 模型SGMSE 是一款基于分数生成模型(Score-based Generative Models)的语音增强工具,旨在解决复杂环境下的噪声去除问题。与传统的谱减法或简单的滤波不同,它通过生成式方法重建纯净语音,能更有效地处
mpse smoe speech enhancement
AI 模型mpse-smoe 是一款专注于语音增强的轻量化模型,采用了高效的混合专家(MoE)架构。它旨在解决录音环境中的背景噪声干扰,在保持语音自然度的同时,通过动态激活参数来提升降噪质量。对于需要处理低质量音频、播客后期清理或
unet speech enhancement
AI 模型U-Net Speech Enhancement 是一款基于经典 U-Net 架构的语音增强模型,旨在通过深度学习手段从嘈杂的背景中提取纯净的人声。它通过编码器-解码器结构捕捉语音的时频特征,能够有效过滤环境噪音并降低回
speech enhancement mask unet
AI 模型这是一个基于 Mask UNet 架构的语音增强模型,旨在通过掩码机制有效分离语音信号与背景噪声。与传统的滤波方法不同,它能更精准地在时频域还原人声,特别适合处理环境嘈杂的录音素材。对于开发者而言,该模型上手门槛较低,可
AI 模型 · 文生视频
查看全部 (19)Sulphur 2 base
AI 模型Sulphur 2 base 是由 SulphurAI 推出的文本生成视频基础模型。它采用了开放的 Apache-2.0 协议,旨在为开发者提供一个灵活的底层能力池。与许多闭源的视频生成工具不同,该模型更侧重于作为“基座
Wan2.2 TI2V 5B Diffusers
AI 模型Wan2.2 TI2V 5B 是一款由 Wan-AI 推出的图生视频模型,目前已通过 Diffusers 库集成,极大降低了开发者的部署门槛。该模型主打高质量的动态还原,能够将静态图片转化为流畅且符合物理逻辑的视频片段。
Wan2.1 T2V 1.3B Diffusers
AI 模型Wan2.1 T2V 1.3B 是一个轻量级的文本生成视频模型,现已集成至 Diffusers 库中,极大降低了开发者的部署门槛。相比于动辄数十 B 参数的视频大模型,1.3B 版本在保持不错画质的同时,大幅降低了显存占
MiniMax H3 Turbo Lora ComfyUI
AI 模型MiniMax H3 Turbo Lora 是专为 ComfyUI 设计的视频生成增强插件,旨在通过 Lora 微调技术提升视频生成的可控性和视觉质量。对于习惯使用 ComfyUI 工作流的开发者来说,它将 MiniMa
Sulphur 2 base GGUF
AI 模型Sulphur 2 base GGUF 是一个基于 GGUF 格式量化的文本生成视频基础模型。对于国内开发者而言,GGUF 格式最大的意义在于大幅降低了显存门槛,使得在消费级 GPU 甚至大内存 Mac 上本地部署视频生
Wan2.2 T2V A14B Diffusers
AI 模型Wan2.2 T2V A14B 是一款由 Wan-AI 推出的高性能文本生成视频模型。该版本通过 Diffusers 库集成,极大地降低了开发者的部署门槛,能够快速适配到现有的 AI 工作流中。它在视频画质、动态流畅度以
Wan2.2 T2V A14B GGUF
AI 模型Wan2.2 T2V A14B GGUF 是由 QuantStack 提供的量化版本视频生成模型。它将原版 14B 参数的强大视频生成能力通过 GGUF 格式进行压缩,极大地降低了显存占用,让消费级显卡用户也能在本地尝试
FastWan2.2 TI2V 5B FullAttn Diffusers
AI 模型FastWan2.2 是一款由 FastVideo 推出的 5B 参数量级视频生成模型,主打 TI2V(文本到视频)能力。该版本采用了 FullAttn(全注意力机制)并适配了 Diffusers 库,这意味着开发者可以
AI 模型 · 文本生成
查看全部 (18)Llama 3.1 405B
AI 模型开源大语言模型
Mixtral 8x7B
AI 模型稀疏专家混合模型
Qwen3 0.6B
AI 模型Qwen3-0.6B 是阿里巴巴通义千问系列中极其轻量化的文本生成模型。它主打“小而强”,在极低的参数规模下尽可能保留了核心的语言理解能力。这款模型非常适合对资源敏感的场景,比如在手机、嵌入式设备上本地部署,或者作为大型
Qwen3 8B
AI 模型Qwen3-8B 是阿里通义千问系列的最新中量级模型。在保持 8B 参数量带来的极高推理效率的同时,它在中文语境理解、逻辑推理以及代码编写能力上有了显著提升。对于开发者而言,它非常适合部署在消费级显卡上,用于构建本地知识
tiny Qwen2ForCausalLM 2.5
AI 模型tiny Qwen2ForCausalLM 2.5 是基于阿里通义千问 Qwen2 架构的轻量化实验版本。它在保持 Qwen 系列优秀中文理解能力的同时,极大压缩了参数规模,旨在为开发者提供一个低资源消耗的测试基准。该模
gpt2
AI 模型GPT-2 是现代大语言模型的奠基之作,由 OpenAI 开源。虽然在当前 LLM 时代它已不再是性能顶端,但其轻量级的架构使其成为开发者学习 Transformer 原理、构建小型文本生成应用或在本地低功耗设备上部署的
Qwen2.5 7B Instruct
AI 模型Qwen2.5-7B-Instruct 是阿里巴巴通义千问团队推出的新一代主力尺寸模型。它在保持 7B 轻量级参数量的同时,大幅强化了代码编写、数学推理和指令遵循能力,性能在同量级模型中处于顶尖水平。对于开发者而言,该模
Qwen3.6 35B A3B NVFP4
AI 模型Qwen3.6 35B A3B NVFP4 是由 NVIDIA 提供的基于通义千问系列的优化版本。该模型采用了 NVFP4 低精度量化技术,旨在通过大幅降低显存占用,在不牺牲太多性能的前提下,提升在 NVIDIA GPU
AI 模型 · 句向量
查看全部 (18)all-MiniLM-L6-v2
AI 模型快速句子嵌入
paraphrase multilingual MiniLM L12 v2
AI 模型这是一个轻量级且高效的多语言文本向量化模型,专门用于将句子转换为高维向量,从而计算文本间的语义相似度。相比于体积庞大的 LLM,它在资源占用极低的情况下,能快速处理包括中文在内的多种语言。对于开发者而言,它是构建 RAG
bge m3
AI 模型BGE-M3 是由北京智源人工智能研究院(BAAI)推出的全能型向量模型,旨在解决传统 Embedding 模型在多语言支持和检索长度上的痛点。它最大的特色是“三合一”能力,同时支持稠密检索、稀疏检索和多向量检索,能够极
all mpnet base v2
AI 模型all-mpnet-base-v2 是一款在语义相似度任务上表现极佳的轻量级文本向量化模型。它基于 MPNet 架构,通过大规模句子对预训练,能够将文本精准地映射为高维向量。对于中国开发者而言,它是构建 RAG(检索增强
nomic embed text v1.5
AI 模型nomic embed text v1.5 是一款高性能的开源文本向量化模型,主要用于将文本转换为高维向量,以便计算机理解语义相似度。它在中文等多语言支持和长文本处理上表现稳健,是构建 RAG(检索增强生成)系统的核心组
multilingual e5 small
AI 模型multilingual-e5-small 是一款轻量级且高性能的多语言文本向量化模型。它将文本转化为高维向量,通过计算余弦相似度来衡量语义相关性,而非简单的关键词匹配。该模型在 100 多种语言上表现均衡,非常适合中文
paraphrase multilingual mpnet base v2
AI 模型这是一个基于 MPNet 架构的轻量级多语言向量模型,专门为语义相似度计算而优化。与通用 LLM 不同,它不负责生成文本,而是将句子转化为高质量的数值向量(Embedding)。它支持包括中文在内的多种语言,能够精准捕捉
multilingual e5 base
AI 模型multilingual-e5-base 是一款高性能的多语言文本向量化模型,由 intfloat 发布。它将文本转化为高维向量,能够精准捕捉语义相似度,而非简单的关键词匹配。对于中国开发者而言,该模型最大的价值在于其强
AI 模型 · 问答
查看全部 (18)electra large discriminator squad2 512
AI 模型这是一个基于 ELECTRA-Large 架构并在 SQuAD 2.0 数据集上微调的判别器模型,专注于高质量的阅读理解与问答任务。与传统的 BERT 不同,它采用了更高效的判别式预训练,使其在捕捉文本细微语义差异方面表
roberta base squad2
AI 模型RoBERTa-base-SQuAD2 是一款专注于阅读理解(QA)的经典预训练模型。它基于 RoBERTa 架构,并在 SQuAD 2.0 数据集上进行了精调,最大的特点是具备“拒答”能力——当问题在给定文本中找不到答
koelectra base v3 finetuned korquad
AI 模型KoELECTRA-base-v3-finetuned-KorQuAD 是一个专门针对韩语问答(QA)任务微调的轻量级预训练模型。它基于 ELECTRA 架构,通过在 KorQuAD 数据集上进行精调,能够高效地从给定的
distilbert base cased distilled squad
AI 模型DistilBERT-base-cased-distilled-SQuAD 是一个经过知识蒸馏的轻量化 BERT 模型,专门针对 SQuAD 问答数据集进行了微调。它在保留 BERT 绝大部分自然语言理解能力的同时,显著
bert large uncased whole word masking squad2
AI 模型这是一个基于 BERT-Large 架构并经过 SQuAD 2.0 数据集微调的阅读理解模型。相比基础版,它采用了 Whole Word Masking(全词掩码)技术,能更精准地捕捉词义,在处理复杂问答时鲁棒性更强。该
tinyroberta squad2
AI 模型tinyroberta-squad2 是一款轻量级的问答(QA)模型,基于 RoBERTa 架构并在 SQuAD 2.0 数据集上进行了微调。它最大的特点是在保持较高阅读理解能力的同时,极大地压缩了模型体积,非常适合对推
koelectra small v2 distilled korquad 384
AI 模型这是一个基于 KoELECTRA-Small 架构并针对 KorQuAD 数据集进行蒸馏优化的小型韩语问答模型。它在保证轻量化的同时,专门强化了对韩语阅读理解和答案提取的能力。对于需要处理韩语问答、构建轻量级客服机器人或
xlm roberta base squad2
AI 模型xlm-roberta-base-squad2 是一款基于多语言 RoBERTa 预训练模型、并在 SQuAD 2.0 数据集上微调的阅读理解模型。它最核心的竞争力在于强大的跨语言能力,能够处理包括中文在内的多种语言问答
AI 模型 · 表格问答
查看全部 (18)tapex base finetuned wikisql
AI 模型TaPEX 是微软推出的专门针对表格问答(Table QA)优化的预训练模型。与通用 LLM 不同,它在结构化数据理解上做了深度强化,特别是这个在 WikiSQL 数据集上微调的版本,能够精准地将自然语言问题转化为对表格
tapas large finetuned sqa
AI 模型TAPAS Large (SQuAD 微调版) 是 Google 推出的专门针对表格问答(Table QA)的预训练模型。不同于传统的 LLM 需要将表格转换为文本描述,TAPAS 能够直接理解表格的结构化布局,通过对单
tapas base finetuned wtq
AI 模型TAPAS Base Finetuned WTQ 是 Google 推出的专门针对表格问答(Table QA)优化的模型。与通用 LLM 不同,它能直接理解表格的行列结构,无需将表格转换为纯文本,从而在处理 WikiTa
tapas base finetuned sqa
AI 模型TAPAS Base Finetuned SQA 是 Google 推出的专门用于表格问答(Table QA)的预训练模型。与通用 LLM 不同,它能直接理解表格的行列结构,无需将表格转换为文本描述即可执行类似 SQL
tapas large finetuned wtq
AI 模型TAPAS Large Finetuned WTQ 是由 Google 开发的一款专门针对表格问答(Table QA)优化的模型。不同于传统的文本 LLM 需要将表格转换为 Markdown 或 JSON 才能处理,TA
tapas tiny finetuned sqa
AI 模型Tapas Tiny 是一款由 Google 开发的轻量级表格问答模型,专门针对 SQuAD 风格的表格问答数据集进行了微调。与传统的‘将表格转为文本’再交给 LLM 的做法不同,Tapas 能直接理解表格结构并从中提取
tiny tapas random wtq
AI 模型tiny-tapas-random-wtq 是一款专注于表格问答(Table QA)的轻量化模型。它基于 TAPAS 架构,专门针对 WikiTableQuestions 数据集进行了优化,能够直接理解表格结构并回答相关
tiny tapas random sqa
AI 模型tiny-tapas-random-sqa 是一款专注于表格问答(Table QA)的轻量化模型。它旨在解决从结构化表格中提取信息并回答自然语言问题的挑战,特别适合那些不需要庞大参数量、但需要快速处理表格数据的场景。对于
AI 模型 · 图像描述
查看全部 (18)blip image captioning base
AI 模型BLIP Image Captioning Base 是由 Salesforce 开发的一款经典视觉-语言预训练模型,专注于将图像内容转化为精准的文字描述。与复杂的通用大模型不同,它是一个轻量级的专项工具,能够快速识别图
PP OCRv5 server det
AI 模型PP OCRv5 server det 是百度飞桨(PaddlePaddle)推出的最新版文字检测模型。作为工业级 OCR 链路的“眼睛”,它专注于在图像中精准定位文字区域,而非识别具体字符。相比轻量化版本,server
manga ocr base
AI 模型manga ocr base 是一款专为漫画场景优化的图像文字识别模型。不同于通用 OCR 难以处理漫画中垂直排版、艺术字体或复杂背景的问题,该模型针对日漫等特定排版进行了深度优化,能更精准地提取对话框中的文本。对于想要
blip image captioning large
AI 模型BLIP Image Captioning Large 是由 Salesforce 开发的一款成熟图像描述模型。它擅长将视觉信息转化为自然语言,能准确地为图片生成简洁、客观的文字描述。对于开发者而言,它非常适合用于构建自
en PP OCRv5 mobile rec
AI 模型PP-OCRv5 mobile rec 是百度飞桨(PaddlePaddle)推出的轻量化文本识别模型,专门针对移动端和边缘设备优化。它在保持高识别精度的同时,极大地降低了推理延迟和内存占用,非常适合集成到手机 App
UVDoc
AI 模型UVDoc 是由百度飞桨(PaddlePaddle)推出的文档图像理解模型,专注于将复杂的文档图片转化为结构化文本。它不同于简单的 OCR 文字识别,而是能够更好地理解文档的版式布局,尤其擅长处理包含表格、标题和正文的扫
trocr small handwritten
AI 模型TrOCR-small-handwritten 是微软推出的轻量级光学字符识别(OCR)模型,专门针对手写文本识别进行了优化。它摒弃了传统的 OCR 管道,采用 Transformer 架构直接将图像转化为文本,能有效处
pix2text mfr
AI 模型pix2text-mfr 是一款专注于数学公式与文本识别的开源 OCR 工具。与通用 OCR 不同,它专门针对学术论文、教材等复杂排版场景进行了优化,能够精准地将图片中的数学公式转换为 LaTeX 格式,并同步还原正文文
AI 模型 · 多模态对话
查看全部 (18)Qwen3.5 9B
AI 模型Qwen3.5 9B 是阿里通义千问家族的最新轻量化多模态模型。它在保持 9B 参数规模的同时,显著增强了对图像和文本的综合理解能力。对于中国开发者而言,该模型最大的优势在于其极高的推理能效比,能够轻松部署在消费级显卡上
Qwen3.6 35B A3B FP8
AI 模型Qwen3.6 35B A3B FP8 是一款基于混合专家架构(MoE)的多模态模型,旨在平衡推理成本与理解能力。它支持图像与文本的混合输入,能够高效处理复杂的视觉分析任务。通过 FP8 量化,该模型在大幅降低显存占用和
gemma 4 26B A4B it
AI 模型Gemma 4 26B A4B it 是 Google 推出的最新开源多模态模型,主打高效能与强推理。它打破了纯文本限制,能够直接理解图像输入并输出高质量文本,非常适合需要视觉分析、文档解析或图文问答的开发者。相比于闭源
gemma 4 31B it
AI 模型Gemma 4 31B-it 是 Google 推出的一款高性能开源多模态模型。它在保持中等参数规模的同时,显著增强了对图像和文本的综合理解能力,能够高效处理复杂的图文分析任务。对于中国开发者而言,该模型采用 Apach
Qwen2.5 VL 7B Instruct
AI 模型Qwen2.5-VL-7B-Instruct 是阿里通义千问团队推出的新一代多模态视觉语言模型。相比前代,它在图像理解、文档解析和视频分析能力上有显著提升,尤其擅长处理高分辨率图片中的细节文字和复杂图表。对于开发者而言,
Qwen3.6 27B FP8
AI 模型Qwen3.6-27B-FP8 是阿里通义千问系列的一款高性能多模态模型。它在保持 27B 参数量级强悍理解力的同时,通过 FP8 量化技术大幅降低了显存占用,让开发者在消费级显卡上也能流畅运行。该模型支持图文输入,能够
Qwen3.5 4B
AI 模型Qwen3.5 4B 是一款兼顾轻量化与多模态能力的视觉语言模型。它在保持 4B 小参数规模的同时,实现了高效的图文理解能力,能够精准分析图像内容并结合文本指令进行推理。对于开发者而言,该模型极大地降低了部署门槛,非常适
Qwen2.5 VL 3B Instruct
AI 模型Qwen2.5 VL 3B Instruct 是阿里通义千问推出的轻量级视觉语言模型。它在极小的参数规模下,实现了极强的图像理解和多模态推理能力,能够精准识别图片中的细节并进行复杂的文本分析。对于开发者而言,3B 的尺寸
AI 模型 · 视觉检测跟踪
查看全部 (18)table transformer structure recognition
AI 模型Table Transformer 是微软推出的专门用于表格结构识别的模型。它将表格解析视为目标检测任务,能够精准地从文档图像中定位表格区域并识别内部的行、列及单元格结构。对于开发者而言,它是构建 RAG(检索增强生成)
table transformer detection
AI 模型Table Transformer Detection 是由微软推出的专门用于表格结构识别的模型。它解决了 OCR 领域中最头疼的“表格定位”问题,能精准地在复杂文档页面中检测出表格的位置及其内部的行列结构。对于需要处理
yolos small
AI 模型YOLOS-Small 是一款将 Transformer 架构引入目标检测领域的轻量化模型。与传统的 YOLO 系列不同,它摒弃了复杂的卷积骨干网络,直接利用 Vision Transformer (ViT) 处理图像,
PP DocLayoutV3 safetensors
AI 模型PP DocLayoutV3 是由百度 PaddlePaddle 推出的高性能文档布局分析模型。它专注于解决 PDF 或扫描件中复杂的版面解析问题,能够精准识别正文、表格、图片及页眉页脚等元素。相比通用目标检测模型,它针
rtdetr r101vd coco o365
AI 模型RT-DETR 是一款由北大团队推出的实时端到端目标检测模型。它打破了以往实时检测模型(如 YOLO 系列)过度依赖 NMS(非极大值抑制)的瓶颈,通过引入 Transformer 架构实现了真正的端到端预测,在保持极高
rtdetr v2 r18vd
AI 模型RT-DETR v2 r18vd 是由北京大学团队开发的实时端到端目标检测模型。相比传统的 YOLO 系列,它最大的优势在于采用了 Transformer 架构且无需 NMS(非极大值抑制)后处理,有效解决了检测框冗余和
detr resnet 50
AI 模型DETR (Detection Transformer) 是由 Facebook 提出的开创性目标检测模型,它彻底改变了传统检测任务对 Anchor(锚框)和 NMS(非极大值抑制)的依赖。该版本采用 ResNet-50
table transformer structure recognition v1.1 all
AI 模型Table Transformer (TATR) 是微软推出的一款专门用于文档表格结构识别的深度学习模型。它将表格识别视为目标检测任务,能够精准地从复杂的 PDF 或图像文档中定位表格区域,并解析出其中的行、列及单元格结
AI 模型 · 文本摘要
查看全部 (17)BART Large CNN
AI 模型摘要和文本生成
distilbart cnn 12 6
AI 模型distilbart-cnn-12-6 是一款基于 BART 架构并经过蒸馏压缩的轻量级文本摘要模型。它在 CNN/Daily Mail 数据集上进行了微调,核心能力是将长篇文章精炼为简洁的摘要。相比原版 BART,它在
pegasus xsum
AI 模型Pegasus XSum 是由 Google 开发的专门用于“极致摘要”的预训练模型。与通用 LLM 不同,它专注于将长篇文章浓缩成一句极具概括性的摘要(类似新闻标题),而非简单的信息提取。对于中国开发者来说,它非常适合
financial summarization pegasus
AI 模型Financial Summarization Pegasus 是一款专门针对金融领域微调的摘要生成模型。不同于通用模型,它深度优化了对财报、市场分析和金融新闻等专业文本的理解力,能够精准提取核心财务指标和关键事件,有效
bart large cnn samsum
AI 模型这是一个基于 BART-Large 架构并针对 CNN/DailyMail 和 SAMSum 数据集进行微调的文本摘要模型。它专注于将长文章或对话记录精炼为简洁的摘要,能够较好地处理新闻类报道和日常聊天记录。对于中国开发
distilbart xsum 12 6
AI 模型distilbart-xsum-12-6 是一款基于 BART 架构的轻量化文本摘要模型。它通过知识蒸馏技术,在保持强摘要能力的同时大幅降低了计算开销,非常适合需要快速处理长文本并生成极简摘要(XSum 风格)的场景。对
text summarization
AI 模型这是一个由 Falconsai 提供的轻量级文本摘要模型,专注于将长文本快速精炼为核心要点。与通用大模型不同,它采用了任务特定的优化,旨在降低推理成本并提升摘要的客观性,避免产生无关的幻觉内容。对于开发者而言,该模型非常
MEETING SUMMARY
AI 模型MEETING SUMMARY 是一款专注于会议纪要提炼的轻量化摘要模型。它针对会议对话场景进行了优化,能够将冗长的讨论记录快速转化为结构清晰的要点总结。对于经常需要处理会议录音转文字、整理周报或同步项目进度的开发者和职
AI 模型 · 文本分类
查看全部 (17)bge reranker v2 m3
AI 模型BGE Reranker v2 M3 是由北京智源人工智能研究院(BAAI)推出的高性能重排序模型。在 RAG(检索增强生成)工作流中,它扮演着“精筛”的角色:先由向量模型快速召回候选文档,再由它对结果进行深度语义打分,
finbert
AI 模型FinBERT 是一个专门针对金融领域微调的自然语言处理模型,基于 BERT 架构并使用了大规模金融语料库进行训练。与通用模型不同,它能精准识别金融文本中特有的语义倾向(例如“利率上升”在不同语境下的利好或利空),极大地
Prompt Guard 86M
AI 模型Prompt Guard 86M 是 Meta 推出的一款轻量级文本分类模型,专门用于识别提示词注入(Prompt Injection)攻击。它不像通用大模型那样处理复杂任务,而是扮演“安检员”的角色,在用户输入进入核心
bge reranker base
AI 模型bge-reranker-base 是由北京智源人工智能研究院(BAAI)推出的轻量级重排序模型。在 RAG(检索增强生成)流程中,它通常接在向量检索之后,用于对初筛出的文档进行精准的二次打分,有效解决向量检索在处理长文
distilbert base uncased finetuned sst 2 english
AI 模型这是一个基于 DistilBERT 的轻量级文本分类模型,专门在 SST-2 情感分析数据集上进行了微调。简单来说,它是一个高效的“情感检测器”,能快速判断英文文本是正面还是负面评价。相比于原版 BERT,它在保持绝大部
twitter roberta base sentiment latest
AI 模型这是一个由卡迪夫大学(CardiffNLP)基于 RoBERTa 架构微调的轻量级情感分析模型。它专门在海量推特数据上进行训练,因此对社交媒体特有的非规范语言、网络俚语以及表情符号(Emoji)有极强的捕捉能力。相比于通
koelectra small v3 nsmc
AI 模型Koelectra-small-v3-nsmc 是一款针对韩语文本分类优化的轻量化模型。它基于 ELECTRA 架构,并在 NSMC(Naver 电影评论数据集)上进行了精调,擅长处理韩语的情感分析和文本分类任务。对于中
tiny Qwen2ForSequenceClassification 2.5
AI 模型tiny Qwen2ForSequenceClassification 2.5 是一款基于 Qwen2 架构的轻量化文本分类模型。它在保持通义千问系列强大语义理解能力的同时,通过极小的参数规模实现了高效的序列分类,非常适
AI 模型 · 命名实体识别
查看全部 (17)indonesian roberta base posp tagger
AI 模型这是一个基于 RoBERTa-base 架构的印尼语词性标注(POS Tagging)模型。对于需要处理印尼语自然语言处理(NLP)任务的开发者来说,它是构建语法分析、命名实体识别或文本挖掘等上游任务的基础工具。该模型专
stanford deidentifier base
AI 模型Stanford Deidentifier Base 是一款专注于医疗健康领域隐私脱敏的命名实体识别(NER)模型。它能精准识别文本中的患者姓名、日期、地点等敏感个人信息(PHI),帮助开发者在不泄露隐私的前提下处理医疗
bert base NER
AI 模型bert-base-NER 是一个基于 BERT 基础模型微调的命名实体识别(NER)模型。它将预训练模型的语义理解能力转化为对特定实体的捕捉能力,能够从非结构化文本中精准提取出人名、地名、组织机构名等关键信息。对于开发
bert large cased finetuned conll03 english
AI 模型这是一个基于 BERT-Large 预训练模型,并针对 CoNLL-03 英文数据集微调而成的命名实体识别(NER)模型。简单来说,它能精准地从英文文本中抽取出人名、地名、组织机构名等关键实体。对于需要处理英文语料的中国
punctuate all
AI 模型punctuate all 是一个专注于文本标点恢复的 Token 分类模型。它主要解决的是在语音转文字(ASR)或某些低质量文本抓取中常见的“缺失标点”痛点,能通过上下文语义自动补全句号、逗号等符号。对于开发者而言,它
ner english fast
AI 模型ner-english-fast 是由 Flair 团队推出的轻量级英文命名实体识别(NER)模型。它专为追求推理速度的场景设计,能够快速从英文文本中提取人名、地名和组织机构等关键实体。相比于大型 Transformer
sat 3l sm
AI 模型Sat 3l sm 是一款专注于文本分词与标记分类(Token Classification)的轻量级 AI 模型。不同于通用的大语言模型,它专注于对文本中的特定元素进行精准识别和标注,类似于一个高效的“文本扫描仪”。由
bert portuguese ner
AI 模型这是一个基于 BERT 架构并针对葡萄牙语进行微调的命名实体识别(NER)模型。它专门用于从非结构化文本中精准提取人名、地名、组织机构名等关键实体。对于需要处理葡语数据的开发者来说,它避开了通用模型在小语种上的识别精度问
AI 模型 · 完形填空
查看全部 (17)bert base uncased
AI 模型BERT Base Uncased 是由 Google 推出且极具里程碑意义的预训练模型。它采用了双向 Transformer 架构,能够深度理解上下文语义,而非简单的从左到右扫描。该版本在预训练时去除了英文大小写区分(
xlm roberta base
AI 模型XLM-RoBERTa Base 是由 FacebookAI 推出的多语言预训练模型,本质上是 RoBERTa 在海量多语言语料上的扩展版。它最大的特点是不依赖语言特定的标记,能够直接处理 100 多种语言。对于中国开发
roberta base
AI 模型RoBERTa-base 是对 BERT 的优化增强版,由 Facebook AI 开发。它在预训练阶段通过更大的数据集、更长的训练时间和动态掩码策略,显著提升了对自然语言的理解能力。对于中国开发者而言,它是一个极其稳定
roberta large
AI 模型RoBERTa-large 是对经典 BERT 的强力优化版,由 Meta (Facebook AI) 推出。它通过更海量的数据集、更长的训练时长以及取消掉 BERT 中的下一句预测 (NSP) 任务,显著提升了模型在自
distilbert base uncased
AI 模型DistilBERT 是 BERT 的轻量化精简版,通过知识蒸馏技术在保留大部分自然语言理解能力的同时,大幅降低了模型体积和推理延迟。它采用了 uncased 版本,这意味着不区分大小写,更适合处理通用文本。对于开发者而
xlm roberta large
AI 模型XLM-RoBERTa Large 是由 FacebookAI 推出的一个强力多语言预训练模型。它在 RoBERTa 的基础上通过海量多语言数据训练,解决了传统模型在处理非英语语料时效果打折的问题。对于开发者而言,它最核
ModernBERT base
AI 模型ModernBERT 是对经典 BERT 架构的一次现代化升级,旨在解决传统编码器模型在长文本处理和训练效率上的短板。它引入了旋转位置编码(RoPE)和 GeGLU 激活函数,原生支持高达 8k 的上下文窗口,极大提升了
mdeberta v3 base
AI 模型mDeBERTa-v3-base 是微软推出的多语言增强版 BERT 模型,采用了更高效的解耦注意力机制(Disentangled Attention)。相比传统的 BERT 或 RoBERTa,它在处理多种语言的语义理
AI 模型 · 特征提取
查看全部 (17)bge small en v1.5
AI 模型bge-small-en-v1.5 是由北京智源人工智能研究院(BAAI)推出的轻量级英文文本向量模型。它并非对话模型,而是专门用于将文本转化为高维向量的特征提取工具。在 RAG(检索增强生成)架构中,它扮演着“索引员”
bge large en v1.5
AI 模型bge-large-en-v1.5 是由北京智源人工智能研究院(BAAI)推出的高性能英文文本向量模型。它并非用于对话的 LLM,而是将文本转化为高维向量的特征提取工具,在检索增强生成(RAG)架构中扮演关键角色。该模型
bge base en v1.5
AI 模型bge-base-en-v1.5 是由北京智源人工智能研究院(BAAI)推出的轻量级英文向量模型。它专注于将文本转化为高质量的向量表示(Embedding),是构建 RAG(检索增强生成)系统的核心组件。相比于大型 LL
Qwen3 Embedding 0.6B
AI 模型Qwen3 Embedding 0.6B 是阿里通义千问团队推出的轻量级文本向量化模型。不同于生成式 LLM,它专注于将文本转化为高质量的数值向量,是构建 RAG(检索增强生成)系统的核心组件。该模型在保持极小参数规模的
multilingual e5 large
AI 模型Multilingual E5 Large 是一款由 intfloat 开发的开源多语言文本嵌入模型。与直接生成文本的 LLM 不同,它专注于将文本转化为高质量的向量(Embedding),是构建 RAG(检索增强生成)
bge small zh v1.5
AI 模型bge-small-zh-v1.5 是由北京智源人工智能研究院(BAAI)推出的轻量级中文文本向量化模型。它专注于将文本转化为高质量的向量表示,是构建 RAG(检索增强生成)系统的核心组件。相比于大语言模型,它的体积极小
granite embedding small english r2
AI 模型Granite Embedding Small English R2 是 IBM 推出的轻量级英文文本向量化模型。它专注于将文本高效转化为高维向量,是构建 RAG(检索增强生成)系统的核心组件。相比于大型模型,它在保持高
mxbai embed large v1
AI 模型mxbai-embed-large-v1 是一款高性能的开源文本向量化模型,旨在将文本转化为高质量的数学向量,以支持高效的语义检索。对于中国开发者而言,它在 RAG(检索增强生成)架构中扮演着至关重要的角色,能够显著提升
AI 模型 · 语音端点检测
查看全部 (17)segmentation 3.0
AI 模型pyannote 的 segmentation 3.0 是一款专注于语音活动检测(VAD)的高性能模型。它能精准识别音频中“有人说话”与“静默/噪声”的分界点,是构建语音处理管线的关键前置步骤。相比于传统的基于能量阈值的
segmentation
AI 模型pyannote 的 segmentation 模型是一款专注于语音活动检测(VAD)的专业工具,旨在从音频流中精准区分出“有人说话”和“静默/噪声”的时段。对于开发者而言,它不是一个对话 AI,而是一个强大的音频预处理
Namo Turn Detector v1 Korean
AI 模型Namo Turn Detector v1 是一款专门针对韩语优化的语音端点检测(VAD)模型。对于开发实时语音交互、AI 助手或会议系统的开发者来说,它解决了对话中最棘手的“抢话”或“响应延迟”问题,能精准识别韩语说话
speaker diarization precision 2
AI 模型Speaker Diarization Precision 2 是由 pyannote 推出的专业级说话人日志模型,核心解决的是“谁在什么时候说话”的问题。不同于基础的语音转文字,它专注于高精度的说话人切分与身份识别,能
Silero VAD v5 MLX
AI 模型Silero VAD v5 MLX 是一个专门为 Apple Silicon 芯片优化的语音活动检测(VAD)模型。简单来说,它的核心能力是精准地从音频流中分辨出“哪里有人在说话”,并过滤掉背景噪音。由于采用了 MLX
silero vad coreml
AI 模型Silero VAD CoreML 是专为苹果生态优化的语音活动检测模型。它能高效地从音频流中实时分辨“有人在说话”还是“环境静默”,且由于采用了 CoreML 加速,在 iOS 和 macOS 设备上运行功耗极低,响应
brouhaha
AI 模型brouhaha 是一款由 pyannote 开发的轻量级语音活动检测(VAD)模型。它专注于从音频流中精准地剔除静音和背景噪音,仅保留有人类说话的片段。对于中国开发者而言,它非常适合作为语音识别(ASR)流水线的前置环
Pyannote Segmentation MLX
AI 模型Pyannote Segmentation MLX 是专为 Apple Silicon 芯片优化的语音活动检测(VAD)模型。它将 Pyannote 强大的语音分割能力通过 MLX 框架迁移至 Mac 端,旨在解决音频预
AI 模型 · 视觉分类
查看全部 (17)mobilenetv3 small 100.lamb in1k
AI 模型MobileNetV3 Small 是专为端侧设备设计的轻量级图像分类模型。该版本基于 timm 库提供,并在 ImageNet-1K 上进行了优化。它通过结合硬件感知网络架构搜索(NAS)和轻量级注意力机制,在极低计算
vit base patch16 224
AI 模型ViT-Base-Patch16-224 是由 Google 推出的视觉 Transformer 标杆模型。它打破了传统 CNN 的卷积结构,直接将图像分块(Patch)并像处理文本一样用 Transformer 架构来
nsfw image detection
AI 模型这是一个由 Falconsai 提供的轻量级图像分类模型,专门用于识别图片中的非安全内容(NSFW)。对于需要构建社区产品、社交应用或内容管理系统的开发者来说,它提供了一个低门槛的自动化审核方案。该模型上手极其简单,无需
tf efficientnetv2 s.in21k ft in1k
AI 模型这是一个基于 TensorFlow 实现的 EfficientNetV2-S 图像分类模型。它在 ImageNet-21K 大规模数据集上进行了预训练,随后在 ImageNet-1K 上进行了微调(Fine-tuning
fairface age image detection
AI 模型FairFace Age Detection 是一款专注于人脸年龄预测的图像分类模型。与通用视觉模型不同,它在数据集构建上特别强调了族群多样性,旨在减少因人种差异导致的年龄估算偏差。该模型上手难度极低,非常适合开发者将其
resnet50.a1 in1k
AI 模型ResNet50 是计算机视觉领域的经典基准模型,而 resnet50.a1 是由 timm 库提供的优化版本,在 ImageNet-1K 数据集上进行了精细调优。它通过残差连接解决了深层网络的梯度消失问题,在保持高效推
resnet18.a1 in1k
AI 模型ResNet18 是计算机视觉领域的经典基准模型,由 timm 库提供此版本。它通过引入残差连接解决了深层网络难以训练的梯度消失问题,在保证性能的同时极大地降低了计算开销。对于开发者而言,它是一个极佳的入门级图像分类模型
resnet 50
AI 模型ResNet-50 是计算机视觉领域的经典里程碑,由微软提出。它通过引入“残差连接”解决了深层网络难以训练的梯度消失问题,使得模型在增加深度提升精度时依然能保持高效收敛。对于中国开发者而言,它不仅是学习深度学习的必经之路
AI 模型 · 音频生成
查看全部 (17)music generation model GGUF
AI 模型这款由 mradermacher 提供的音乐生成模型 GGUF 版本,旨在让开发者在消费级硬件上也能高效运行音频生成任务。通过 GGUF 格式的量化优化,它极大降低了显存占用,解决了原模型对算力要求过高的问题。对于希望在
distilgpt2 abc irish music generation
AI 模型这是一个基于 DistilGPT-2 架构微调的轻量级音频生成模型,专注于爱尔兰传统音乐的创作。它将音乐转化为类文本的序列进行学习,能够生成具有爱尔兰民乐风格的旋律。由于采用了蒸馏模型,该模型对计算资源要求极低,非常适合
music generation
AI 模型这是一个基于 Apache-2.0 开源协议的音频生成模型,旨在将文本描述转化为高质量的音乐片段。与复杂的专业编曲软件不同,它降低了音乐创作的门槛,开发者可以通过 API 快速将其集成到短视频背景音乐生成、游戏动态音效或
GPT2 Music Generation Trained
AI 模型这是一个基于 GPT-2 架构微调的音频生成模型,将原本处理文本的 Transformer 能力迁移到了音乐创作上。它通过学习音乐序列的概率分布,能够根据给定的前奏或风格引导,自动补全或生成一段旋律。对于开发者而言,它提
music generation
AI 模型这是一个基于 MIT 协议的开源音乐生成模型,旨在将文本描述直接转化为音频片段。对于国内开发者而言,它提供了一个轻量级的音频创作方案,能够快速生成背景音乐或短音频素材,无需复杂的编曲知识即可上手。相比于 Suno 或 U
music generation model
AI 模型这是一个基于 Apache-2.0 开源协议的音乐生成模型,旨在为开发者提供灵活的音频创作能力。与常见的商业音乐 AI 不同,它更侧重于通过模型权重实现可定制的音乐合成,适合需要将音频生成能力集成到自有应用中的开发者。无
music generation
AI 模型这是一个基于 MIT 协议开源的轻量级音乐生成模型,旨在为开发者提供低门槛的音频创作能力。不同于复杂的专业编曲软件,该模型侧重于快速生成短片段音乐,非常适合集成到独立游戏、短视频配乐或简单的 AI 创意应用中。由于其开源
Sinhala Audio to Text
AI 模型这是一个专注于僧伽罗语(Sinhala)语音识别的专项模型。对于需要处理斯里兰卡当地语言数据的开发者来说,它解决了通用大模型在小众语种上识别率低、丢词严重的痛点。该模型将音频直接转化为文本,非常适合用于构建当地语言的会议
AI 模型 · 机器翻译
查看全部 (16)t5 small
AI 模型T5 Small 是 Google 推出的文本到文本(Text-to-Text)统一框架的轻量化版本。它将所有 NLP 任务(如翻译、摘要、问答)都转化为相同的输入输出格式,极大地简化了模型部署和任务切换。虽然参数量小,
t5 base
AI 模型T5 (Text-to-Text Transfer Transformer) 是 Google 推出的一款经典预训练模型,其核心逻辑是将所有 NLP 任务(如翻译、摘要、分类)统一转化为“文本到文本”的格式。T5-bas
opus mt nl en
AI 模型Opus-MT 是由 Helsinki-NLP 开发的一系列轻量级机器翻译模型,专注于特定语言对的精准转换。不同于 GPT-4 等通用大模型,它采用了典型的编码器-解码器架构,专为翻译任务优化,因此在处理特定语种(如荷兰
opus mt fr en
AI 模型Opus-MT 是由 Helsinki-NLP 团队基于开源数据集训练的轻量级翻译模型,专门用于法语和英语之间的互译。与 GPT-4 等通用大模型不同,它是一个垂直领域的专用模型,不具备对话能力,但翻译响应速度极快且资源
vntl llama3 8b v2 gguf
AI 模型vntl llama3 8b v2 是一款基于 Llama3-8B 经过专门翻译能力增强的量化模型。它采用了 GGUF 格式,这意味着中国开发者可以通过 llama.cpp 或 LM Studio 等轻量化工具在个人电脑
opus mt en ru
AI 模型Opus-MT-en-ru 是由 Helsinki-NLP 团队基于开源数据集训练的轻量级机器翻译模型,专门用于英文到俄文的互译。不同于 GPT-4 等通用大模型,它是一个专注翻译任务的专用模型,在翻译速度和资源占用上具
opus mt en de
AI 模型Opus-MT-en-de 是由 Helsinki-NLP 团队推出的轻量级翻译模型,专门用于英文到德文的机器翻译。与动辄百亿参数的大模型不同,它专注于单一翻译任务,因此在本地部署时对硬件要求极低,推理速度极快。对于不需
opus mt de en
AI 模型Opus-MT-de-en 是一款由 Helsinki-NLP 团队推出的轻量级专用翻译模型,专注于德语到英语的精准转换。与 GPT-4 等通用大模型不同,它采用了典型的神经机器翻译架构,不占用大量显存,非常适合开发者将
AI 模型 · 视觉问答
查看全部 (16)blip vqa base
AI 模型BLIP VQA Base 是由 Salesforce 开发的一款经典视觉问答模型。它通过将视觉编码器与语言模型相结合,实现了对图像内容的深度理解与交互。与单纯的图像打标不同,该模型支持用户以自然语言对图片进行提问并获得
vilt b32 finetuned vqa
AI 模型ViLT-B32-Finetuned-VQA 是一款基于视觉-语言 Transformer 架构的轻量化视觉问答模型。与传统的 VQA 模型不同,它舍弃了复杂的预训练目标检测网络,直接将图像和文本映射到统一的向量空间,从
MiniCPM V 2
AI 模型MiniCPM-V 2 是由 OpenBMB 团队打造的一款高性能端侧多模态模型。它在保持轻量级参数的同时,展现出了媲美 GPT-4V 的图像理解能力,特别是在高分辨率图像处理和细粒度视觉分析上表现出色。对于中国开发者而
deplot
AI 模型DePlot 是 Google 推出的一款专注于“图表数字化”的视觉问答模型。它不直接回答问题,而是先将复杂的统计图表(如折线图、柱状图)精准地转化为结构化的表格数据,再基于数据进行推理。对于开发者来说,它解决了传统 O
blip vqa capfilt large
AI 模型BLIP VQA Capfilt Large 是由 Salesforce 开发的一款多模态模型,专注于视觉问答(VQA)和图像描述。它在理解图像内容与文本指令的对齐方面表现出色,能够精准地回答关于图片细节的问题。对于中国
Qwen3.5 2B MedVL
AI 模型Qwen3.5 2B MedVL 是一款基于通义千问架构、专注于医疗视觉问答(VQA)的轻量级多模态模型。它通过在医学影像数据集上的深度微调,能够理解 X 光片、CT 等医学图像并回答相关专业问题。由于参数量仅 2B,该
VideoScore2
AI 模型VideoScore2 是一款由 TIGER-Lab 推出的视频质量评估模型,旨在解决视频生成领域中“好坏难量化”的痛点。不同于传统的单一指标,它能像人类一样感知视频的视觉质量和时间连续性,为 AI 生成视频提供客观的打
llava med v1.5 mistral 7b hf
AI 模型LLaVA-Med v1.5 是一款专门针对医疗影像分析微调的多模态大模型,基于 Mistral-7B 构建。它将视觉理解能力与医学专业知识结合,能够通过分析 X 光、CT 等医疗图像来回答复杂的医学问题。对于开发者而言
AI 模型 · 语音识别
查看全部 (16)whisperkit coreml
AI 模型WhisperKit CoreML 是将 OpenAI 的 Whisper 语音识别模型针对苹果生态深度优化的版本。它通过 Core ML 框架,让模型能高效调用 iPhone、iPad 和 Mac 的 NPU(神经网络
speaker diarization 3.1
AI 模型Speaker Diarization 3.1 是由 pyannote 团队推出的专业级“说话人日志”模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不同于传统的语音转文字(ASR),而是专注于音频中的身份切分。
whisper large v3 turbo
AI 模型Whisper large-v3-turbo 是 OpenAI 推出的语音识别加速版模型。它在保持 v3 强悍的多语言识别和翻译能力的同时,通过优化解码速度,极大地降低了推理延迟。对于开发者而言,它解决了原版 large
wav2vec2 large xlsr 53 japanese
AI 模型这是一个基于 Meta 的 wav2vec 2.0 架构并经过大规模多语言预训练(XLSR-53)的日语语音识别模型。它采用了自监督学习机制,能够高效地将日语语音转化为文本。对于开发者而言,该模型在处理日语口语识别、会议
speaker diarization community 1
AI 模型Speaker Diarization Community 1 是一款由 pyannote 提供的开源说话人日志(Diarization)模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不像传统的 ASR 仅将语
wav2vec2 large xlsr 53 portuguese
AI 模型这是一个基于 Meta 的 wav2vec 2.0 架构,针对葡萄牙语进行微调的开源语音识别(ASR)模型。它采用了 XLS-R 跨语言预训练权重,这意味着它在处理语音信号时具有更强的鲁棒性,能够将葡萄牙语语音高效地转化
voice activity detection
AI 模型pyannote 的 VAD(语音活动检测)是一个专注于从音频流中精准剔除静音和背景噪音、仅保留人声片段的轻量级工具。对于开发者来说,它不是一个完整的语音转文字模型,而是 ASR(语音识别)流程中的关键预处理步骤。通过在
Qwen3 ASR 1.7B
AI 模型Qwen3 ASR 1.7B 是阿里通义千问团队推出的轻量级自动语音识别模型。它在保持极小参数规模的同时,优化了语音到文本的转换效率,非常适合部署在端侧设备或对响应延迟要求极高的实时场景中。对于开发者而言,该模型上手门槛
AI 模型 · 文生图
查看全部 (15)Stable Diffusion XL
AI 模型高质量图像生成
stable diffusion xl base 1.0
AI 模型SDXL 1.0 是目前开源图像生成领域的事实标准,相比早期的 v1.5 版本,它在画质、构图以及对复杂提示词的理解力上有质的飞跃。它最大的特点是原生支持 1024x1024 分辨率,解决了以往模型在生成大图时经常出现的
stable diffusion v1 5
AI 模型Stable Diffusion v1.5 是目前 AI 绘画社区生态最繁荣的经典模型。虽然它不是最新的版本,但凭借极低的硬件门槛和开放的权重,成为了无数开发者和创作者的首选。它最大的优势在于极强的可塑性,用户可以通过加
dreamshaper 7
AI 模型DreamShaper 7 是一款基于 Stable Diffusion 微调的通用型图像生成模型,旨在在写实感与艺术风格之间取得平衡。它不像某些垂直模型那样只擅长单一领域,而是能较好地处理人像、风景及概念艺术。对于习惯
Z Image Turbo
AI 模型Z Image Turbo 是由阿里通义团队推出的高性能文本生成图像模型。它主打“快”与“准”,通过优化推理效率,在保证画面质量的同时极大地缩短了出图时间,非常适合需要快速迭代视觉方案的开发者和设计师。该模型对中文语义理
sd turbo
AI 模型SD Turbo 是 Stability AI 推出的实时图像生成模型,其核心突破在于将生成速度提升到了极致。它采用了先进的蒸馏技术,能够将原本需要数十步的迭代过程压缩到 1 步,实现了真正的“边输入边出图”。对于开发者
Realistic Vision V5.1 noVAE
AI 模型Realistic Vision V5.1 是一款在 Stable Diffusion 社区极具口碑的写实风微调模型。它专注于消除 AI 绘画常见的“塑料感”,在皮肤纹理、光影过渡和真实场景还原上表现出色,非常适合需要出
stable diffusion v1 4
AI 模型Stable Diffusion v1.4 是开源图像生成领域的里程碑之作。它最大的特点是极高的自由度和低门槛的本地部署能力,让开发者无需依赖昂贵的云端 API 即可在消费级显卡上运行。相比于闭源模型,v1.4 拥有极其
AI 模型 · 图片生成图片
查看全部 (14)Qwen Image Edit 2509
AI 模型Qwen Image Edit 2509 是阿里通义千问团队推出的图像编辑模型,主打精准的指令驱动修改。与传统的 AI 绘图不同,它更像是一个懂指令的“智能修图师”,用户无需复杂的 Prompt 工程,直接用自然语言描述
FLUX.2 klein 4B
AI 模型FLUX.2 klein 4B 是一款由 Black Forest Labs 推出的轻量级图像到图像(Image-to-Image)模型。与追求极致细节的大模型不同,klein 4B 侧重于在保持原图结构的同时,高效地实
Qwen Image Edit 2511 Lightning
AI 模型Qwen Image Edit 2511 Lightning 是一款主打高效图像编辑的 AI 模型,旨在通过简单的指令实现对图片的精准修改。它不同于从零开始生成图片的文生图工具,而是在现有图像基础上进行局部调整或风格迁移
Qwen Edit 2509 Multiple angles
AI 模型Qwen Edit 2509 Multiple angles 是一款专注于图像局部编辑与多视角一致性生成的 AI 模型。它解决了传统图生图模型在修改细节时容易导致整体崩坏的痛点,能够根据指令对图像特定区域进行精准调整,并
Qwen Image Edit 2511 GGUF
AI 模型Qwen Image Edit 2511 是基于阿里通义千问视觉能力微调的图像编辑模型,目前由 unsloth 提供 GGUF 量化版本,极大降低了本地部署的显存门槛。与传统的 Stable Diffusion 局部重绘
Qwen Image Edit 2511
AI 模型Qwen Image Edit 2511 是阿里 Qwen 团队推出的图像编辑模型,旨在通过简单的指令实现精准的局部修改或全局风格调整。不同于传统的文生图,它更强调对原图的理解与控制,能够有效解决“改掉背景但保留主体”这
FLUX.2 small decoder
AI 模型FLUX.2 small decoder 是 Black Forest Labs 推出的轻量化图像解码组件,主要用于将潜空间(Latent Space)的特征高效还原为高质量像素图像。对于开发者而言,它相当于一个高性能的
FLUX.2 klein base 4B
AI 模型FLUX.2 klein base 4B 是一款由 Black Forest Labs 推出的轻量级图生图(Image-to-Image)模型。它在保持 FLUX 系列强大生成能力的同时,通过 4B 的参数规模优化了推理
AI 模型 · 语音分离
查看全部 (14)bigvgan v2 22khz 80band 256x
AI 模型BigVGAN v2 是由 NVIDIA 推出的高性能神经声码器,专门用于将梅尔频谱图还原为高质量的音频波形。相比前代,v2 版本在 22kHz 采样率下表现出极强的鲁棒性,能有效消除合成语音中的金属感和电音,使人声更加
bigvgan v2 44khz 128band 512x
AI 模型BigVGAN v2 是由 NVIDIA 开发的高性能神经声码器,专门用于将频谱图还原为高质量的音频波形。该版本支持 44.1kHz 高采样率和 128 频段,旨在解决传统 TTS 或语音合成中常见的金属感和伪影问题。对
Qwen3 TTS Tokenizer 12Hz
AI 模型Qwen3 TTS Tokenizer 12Hz 是阿里 Qwen 团队推出的音频离散化分词工具,旨在将连续的音频信号转换为模型可理解的 Token 序列。它采用了 12Hz 的采样率,在保证语音关键特征(如语调、情感)
neucodec
AI 模型NeuCodec 是一款由 Neuphonic 推出的高效音频编解码模型,专注于实现极高压缩比下的高质量音频还原。与传统的音频压缩工具不同,它采用神经音频编解码技术,能够将音频信号压缩至极小尺寸且在解码后保持极高的保真度
TIGER DnR
AI 模型TIGER DnR 是一款专注于音频去噪与修复(De-noising & Restoration)的音频到音频模型。它旨在解决录音环境嘈杂、底噪过大或音质受损等痛点,能够将受干扰的音频信号还原为纯净的人声或背景音。对于播
bigvgan v2 24khz 100band 256x
AI 模型BigVGAN v2 是由 NVIDIA 开发的高质量神经声码器,专门用于将频谱图还原为高质量音频。相比前代,v2 版本在 24kHz 采样率下表现出极强的鲁棒性,能够有效消除合成语音中常见的金属感或电音杂质,使人声更加
MP SENet DNS
AI 模型MP SENet DNS 是一款专注于语音增强(DNS)的音频处理模型,旨在从嘈杂的背景音中精准提取纯净的人声。它采用了 SENet 架构,能够有效抑制环境噪音并减少回声,非常适合需要高质量语音输入但缺乏专业录音环境的开
distill neucodec
AI 模型Distill NeuCodec 是由 Neuphonic 推出的音频编解码模型,专注于高效的音频压缩与重建。与传统的音频压缩方案不同,它利用神经编码技术在极低比特率下依然能保持极高还原度的音质,有效解决了音频传输中的带
AI 模型 · 零样本分类
查看全部 (13)bart large mnli
AI 模型bart-large-mnli 是一个基于 BART 架构并经过 MNLI(自然语言推理)数据集微调的预训练模型。它最大的特点是支持“零样本分类”(Zero-shot Classification),这意味着你无需为特定
distilbert base uncased mnli
AI 模型distilbert-base-uncased-mnli 是一款轻量级的零样本分类(Zero-shot Classification)模型。它基于 DistilBERT 蒸馏技术,在保留大部分 BERT 性能的同时显著降
mDeBERTa v3 base mnli xnli
AI 模型这是一个基于 mDeBERTa v3 架构的零样本分类(Zero-shot Classification)模型,专门针对 MNLI 和 XNLI 等自然语言推理数据集进行了微调。对于中国开发者而言,它的核心价值在于无需针
DeBERTa v3 base mnli fever anli
AI 模型这是一个基于 DeBERTa v3 架构并经过 MNLI、FEVER 和 ANLI 等多个自然语言推理数据集微调的零样本分类模型。与传统的监督学习分类不同,它允许用户在无需训练样本的情况下,直接通过定义标签名称来对文本进
DeBERTa v3 large mnli fever anli ling wanli
AI 模型这是一个基于 DeBERTa v3 large 架构并经过多数据集(如 MNLI、FEVER 等)强化训练的零样本分类模型。它最大的特点是无需针对特定标签进行微调,就能直接对文本进行分类。对于开发者来说,它解决了小样本场
deberta v3 base zeroshot v2.0
AI 模型DeBERTa v3 base zeroshot v2.0 是一款专注于“零样本分类”的轻量级模型。与传统的分类模型不同,它不需要针对特定标签进行训练,只要你给出类别名称,它就能通过语义理解将文本归类。对于中国开发者来说
deberta v3 large zeroshot v2.0
AI 模型DeBERTa v3 large zeroshot v2.0 是一款基于增强型 DeBERTa 架构的零样本分类模型。它最大的特点是无需针对特定标签进行微调,即可直接对文本进行类别判定。对于开发者而言,它解决了标注数据匮
bge m3 zeroshot v2.0
AI 模型bge-m3-zeroshot-v2.0 是一款基于 BGE-M3 增强的零样本分类模型。它最大的优势在于无需针对特定标签进行微调,即可直接对文本进行多标签或单标签分类。对于开发者而言,它解决了传统分类模型需要大量标注数
AI 模型 · 语音合成
查看全部 (13)Kokoro 82M
AI 模型Kokoro 82M 是一款极具性价比的轻量级文本转语音 (TTS) 模型。它最核心的竞争力在于用极小的参数量(仅 82M)实现了媲美大型模型的自然语音合成效果,有效解决了端侧部署时显存占用高和推理延迟大的痛点。对于开发
Qwen3 TTS 12Hz 1.7B CustomVoice
AI 模型Qwen3 TTS 12Hz 1.7B CustomVoice 是一款由阿里 Qwen 团队推出的轻量级语音合成模型。它主打高自然度和个性化定制,通过 1.7B 的参数规模在端侧推理性能与音质之间取得了良好平衡。对于开发
chatterbox
AI 模型Chatterbox 是由 ResembleAI 推出的轻量级开源文本转语音 (TTS) 工具。与追求极致拟人但计算量巨大的商业模型不同,它在保持自然语调的同时,极大地降低了部署门槛。对于开发者而言,它非常适合集成到需要
Kokoro 82M v1.0 ONNX
AI 模型Kokoro 82M 是一款极其轻量级且高效的文本转语音(TTS)模型。虽然参数量仅为 82M,但其音质表现出人意料地自然,远超传统的轻量级合成方案。该版本采用 ONNX 格式,这意味着它脱离了沉重的深度学习框架,可以在
Qwen3 TTS 12Hz 0.6B CustomVoice
AI 模型Qwen3 TTS 12Hz 0.6B 是一款由通义千问团队推出的轻量级语音合成模型。它主打极低的任务延迟和高效的推理速度,0.6B 的小参数量使其能够轻松部署在端侧设备或低配服务器上。该模型支持自定义声音(Custom
OmniVoice
AI 模型OmniVoice 是一款由 k2-fsa 推出的开源语音合成(TTS)模型。它主打高保真的声音克隆能力,能够通过极短的音频样本快速捕捉说话人的音色和情感细节,生成的语音自然度较高,有效缓解了传统 TTS 常见的“机器感
VibeVoice Realtime 0.5B
AI 模型VibeVoice Realtime 0.5B 是微软推出的一款轻量级实时语音合成模型。不同于传统的 TTS,它专注于极低延迟的音频生成,能够实现接近人类自然语调的实时交互。由于参数量仅为 0.5B,该模型对硬件要求极低
Qwen3 TTS GGUF
AI 模型Qwen3 TTS GGUF 是基于通义千问最新语音生成能力并经过 GGUF 量化的版本。它将原本沉重的语音模型轻量化,使得开发者能够在消费级硬件(如个人 PC 或 Mac)上高效部署高质量的文本转语音服务。该模型在自然
AI 模型 · 三维视觉
查看全部 (13)Depth Anything V2 Small hf
AI 模型Depth Anything V2 Small 是一个轻量级的单目深度估计模型,旨在从单张 RGB 图像中精准还原场景的深度信息。相比 V1 版本,V2 在边缘锐度和空间细节上有了显著提升,能够更细腻地处理物体轮廓,减少
DA3METRIC LARGE
AI 模型DA3METRIC LARGE 是一款高性能的单目深度估计模型,专注于将 2D 图像转化为精确的深度图。与传统的相对深度估计不同,它在度量精度上有了显著提升,能够更准确地还原场景中的真实物理距离。对于需要处理空间感知、3
dpt hybrid midas
AI 模型dpt hybrid midas 是由 Intel 推出的深度估计模型,旨在将图像中的空间深度信息量化。它采用了 DPT(Dense Prediction Transformer)架构,通过结合 Transformer
depth anything large hf
AI 模型Depth Anything Large 是一款顶级的单目深度估计模型,能将普通 2D 图像转化为高质量的深度图。与传统深度模型依赖特定数据集不同,它通过海量无标签数据预训练,具备极强的泛化能力,无论是在室内场景还是复杂
Distill Any Depth Large hf
AI 模型Distill Any Depth Large 是一款高效的单目深度估计模型,旨在将复杂的深度感知能力通过知识蒸馏简化,从而在保证精度的前提下提升推理速度。对于开发者而言,它解决了传统深度模型计算量大、部署难的痛点,能够
DA3MONO LARGE
AI 模型DA3MONO LARGE 是由 Depth Anything 团队推出的单目深度估计模型,旨在将 2D 图像精准地转化为深度图。与传统深度模型相比,它在处理复杂场景(如室内细节、自然景观)时具有更强的泛化能力,能够提供
zoedepth nyu kitti
AI 模型ZoeDepth 是一款由 Intel 开发的高性能单目深度估计模型,其核心突破在于解决了传统深度估计模型在“相对深度”与“绝对深度”之间难以兼顾的痛点。它通过结合相对深度模型和度量深度模型,能够从单张 RGB 图像中精
DA3 LARGE 1.1
AI 模型DA3 LARGE 1.1 是一款顶尖的单目深度估计模型,能够将普通 2D 图像转换为高精度的深度图。与以往模型相比,它在空间关系的感知和边缘细节的还原上有了显著提升,能更准确地分辨物体的前后距离。对于开发者而言,该模型
AI 模型 · 视频理解
查看全部 (13)vjepa2 vitl fpc64 256
AI 模型V-JEPA 是 Meta 推出的一款基于自监督学习的视频表征模型。不同之于传统的逐帧分析,它旨在学习视频中的空间-时间预测,能够更高效地捕捉动作逻辑和场景变化。该版本采用 ViT-L 骨干网络,特别强化了特征提取能力,
vjepa2 vitg fpc64 256
AI 模型V-JEPA 是 Meta 推出的一款基于联合嵌入预测架构(JEPA)的视频预训练模型。与传统的生成式模型不同,它通过预测视频掩码部分的潜在表示来学习世界模型,从而在不依赖海量标签的情况下高效理解视频中的动态语义。该版本
xclip base patch32
AI 模型xclip base patch32 是由微软推出的轻量级视频-语言预训练模型,旨在解决视频内容理解中的跨模态对齐问题。与传统的图像 CLIP 不同,它能捕捉视频中的时空动态特征,使机器能够通过文本描述检索视频片段或对视
vivit b 16x2 kinetics400
AI 模型ViViT-B/16x2 是 Google 推出的基于 Transformer 的视频分类模型,旨在将 Vision Transformer (ViT) 的强大表征能力迁移到视频领域。该模型通过对视频帧进行时空切片处理,
xclip base patch32 16 frames
AI 模型xclip base patch32 是由微软推出的视频-文本对齐模型,旨在将 CLIP 的强大视觉表征能力扩展到视频领域。它通过引入时空注意力机制,能够理解视频帧之间的动态关系,而非简单地将其视为单张图片的堆叠。对于开
vivit b 16x2
AI 模型ViViT-B/16x2 是 Google 推出的一款基于 Transformer 架构的视频分类模型。它将视频帧视为 3D 图像块(Tubelets),通过时空注意力机制高效捕捉视频中的动态特征。相比于传统的 2D C
ms eff gcvit deepfake b0 kodf
AI 模型这是一个基于 GCViT 架构的轻量级视频分类模型,专门用于 Deepfake(深度伪造)检测。它由 KoreaPeter 提供,采用 B0 规模的参数设计,旨在兼顾识别精度与推理速度。对于开发者而言,该模型适合集成到视
ms eff gcvit deepfake b5 kodf
AI 模型这是一个由 KoreaPeter 提供的视频分类模型,基于微软的 GCViT 架构并针对 Deepfake(深度伪造)检测进行了深度优化。该模型专注于识别视频中的面部篡改痕迹,能够有效区分真实拍摄与 AI 生成的虚假视频
AI 模型 · 文档理解
查看全部 (12)layoutlm document qa
AI 模型LayoutLM Document QA 是一款专注于文档理解的 AI 模型,它打破了传统 OCR 仅识别文字的局限,能够同时分析文本内容、字体样式和页面布局(如表格、表单位置)。简单来说,它不仅能“读”到字,还能像人一
donut base finetuned docvqa
AI 模型Donut-base-finetuned-docvqa 是由 Naver Clova 开发的一款端到端文档问答模型。它最大的特点是抛弃了传统的 OCR 预处理步骤,直接通过视觉编码器理解文档图像并生成文本答案,有效解决了
tiny doc qa vision encoder decoder
AI 模型这是一个专注于文档问答(DocQA)的轻量级视觉编码-解码模型。与通用大模型不同,它专门针对文档图像的结构化理解进行了优化,能够精准识别图片中的文本位置并回答相关问题。由于模型规模较小,它非常适合部署在端侧设备或对推理延
donut base finetuned docvqa
AI 模型Donut-base-finetuned-docvqa 是一款专注于文档问答(DocVQA)的轻量级 OCR-free 模型。与传统需要先跑 OCR 识别文字再交给 LLM 处理的流水线不同,它采用端到端架构,直接从图像
layoutlmv2 base uncased finetuned docvqa
AI 模型这是一个基于 LayoutLMv2 预训练模型并针对 DocVQA(文档视觉问答)任务微调的轻量化版本。与纯文本模型不同,它能同时理解文档的文字内容、布局位置和视觉特征,非常适合处理发票、表单、报告等具有复杂排版结构的
Llama 3.1 PersianQA
AI 模型Llama 3.1 PersianQA 是基于 Meta Llama 3.1 架构针对波斯语问答场景优化的专项模型。它专注于文档问答(DocQA)任务,能够高效地从波斯语文本中提取关键信息并给出精准回答。对于需要处理中东
layoutlmv3 docvqa t11c5000
AI 模型LayoutLMv3 是目前文档理解领域的主流基座模型,该版本专门针对 DocVQA(文档视觉问答)任务进行了优化。与纯文本 LLM 不同,它能同时处理文本内容、布局位置和图像视觉信息,能够精准地在票据、表单或报告等复杂
bart qg finetune squad
AI 模型这是一个基于 BART 模型并在 SQuAD 数据集上进行微调的问答生成模型,专门用于从给定文档中自动提取并生成问题(Question Generation)。与传统的阅读理解模型(回答问题)相反,它擅长将长文本转化为高
AI 模型 · 多模态表征
查看全部 (11)dinov2 small
AI 模型DINOv2 Small 是 Meta 推出的一款高性能自监督视觉模型。与传统的监督学习模型不同,它在海量数据上通过自监督方式预训练,能够提取出极具判别力的图像特征。对于开发者而言,它相当于一个强大的“视觉编码器”,无需
dinov2 base
AI 模型DINOv2 Base 是 Meta 推出的自监督视觉模型,它不像传统的图像分类模型那样只给出标签,而是将图像转化为高质量的特征向量(Embedding)。对于开发者而言,它就像是视觉领域的“通用特征提取器”,无需大规模
vit small patch14 dinov2.lvd142m
AI 模型这是一个基于 DINOv2 预训练权重的 ViT-Small 视觉模型,采用 14x14 的 patch 分割。不同于传统的有监督模型,它通过自监督学习在海量数据上训练,具备极强的通用特征提取能力。对于中国开发者而言,它
dinov2 large
AI 模型DINOv2 Large 是 Meta 推出的高性能自监督视觉模型,核心能力在于能够将图像转化为极高质量的特征向量(Embedding)。与需要大量标注数据的传统模型不同,它通过海量数据的自监督学习,具备了极强的通用视觉
vit base patch16 224 in21k
AI 模型这是一个由 Google 发布的经典视觉 Transformer (ViT) 预训练模型。它在 ImageNet-21k 海量数据集上进行了预训练,具备极强的图像通用特征提取能力。与传统的 CNN 不同,它将图像切分为
dino vitb16
AI 模型DINO ViT-B/16 是由 Meta (Facebook) 开发的一款强大的自监督视觉特征提取模型。与传统的监督学习不同,它通过自蒸馏机制在海量无标签图像上训练,能够捕捉到极强的语义特征。对于开发者而言,它相当于一
vit base patch14 dinov2.lvd142m
AI 模型这是一个基于 DINOv2 预训练的 ViT-Base 视觉模型,采用 14x14 的 patch 划分。不同于传统的监督学习模型,它通过自监督学习在海量数据集上训练,具备极强的通用特征提取能力。对于中国开发者来说,它最
vit large patch14 reg4 dinov2.lvd142m
AI 模型这是一个基于 DINOv2 预训练的 ViT-Large 视觉模型,由 timm 库提供。它不同于传统的分类模型,而是一个强大的图像特征提取器。该模型在海量数据上经过自监督学习,能够捕捉极细粒度的图像语义特征,无需针对具
AI 模型 · 文本改写
查看全部 (11)flan t5 base
AI 模型Flan-T5 Base 是 Google 基于 T5 架构并经过指令微调(Instruction Tuning)的轻量级模型。与原版 T5 不同,它在大量自然语言任务上进行了增强,使其能够更好地理解指令,而不需要针对每
chronos t5 base
AI 模型Chronos-T5 Base 是亚马逊推出的一款将时间序列预测转化为语言建模任务的创新模型。它打破了传统统计预测的局限,将数值数据量化为 Token,利用 T5 的文本生成能力来预测未来趋势。对于开发者而言,它最大的优
chronos t5 tiny
AI 模型Chronos-T5-Tiny 是亚马逊推出的一个轻量级时间序列预测模型。它巧妙地将时间序列预测转化为语言建模任务,利用 T5 架构处理数值序列,从而实现了无需针对特定数据集进行繁琐调优即可直接进行零样本(Zero-sh
parrot paraphraser on T5
AI 模型Parrot Paraphraser 是一款基于 T5 架构的文本改写模型,专门用于在保持原意不变的前提下,对句子进行同义替换和结构重组。对于开发者而言,它是一个轻量级的 text2text 工具,非常适合集成到需要自动
prot t5 xl uniref50
AI 模型ProtT5-XL-UniRef50 是一款专门为蛋白质序列设计的预训练模型,基于 T5 架构并在大规模 UniRef50 数据库上进行了训练。它将蛋白质序列视为一种特殊的“语言”,能够捕捉氨基酸排列中的深层生物学模式。
chronos t5 small
AI 模型Chronos-T5 Small 是亚马逊推出的一个将时间序列预测转化为语言建模任务的创新模型。它不走传统的统计学路线,而是基于 T5 架构,将数值序列量化为‘词汇’,从而利用大模型的模式识别能力来预测未来趋势。对于开发
unifiedqa t5 small
AI 模型UnifiedQA T5 Small 是由 AllenAI 开发的一款轻量级文本生成模型,基于 T5 架构并针对多种问答任务进行了统一训练。它最大的特点是将不同类型的 QA 任务(如阅读理解、常识问答)统一在同一个框架下
flan t5 small
AI 模型Flan-T5 Small 是 Google 基于 T5 架构并经过指令微调(Instruction Tuning)的轻量化模型。与原版 T5 不同,它通过大量任务指令训练,使其在无需大量样本微调的情况下,就能直接理解并
AI 模型 · 代码生成
查看全部 (10)DeepSeek Coder 33B
AI 模型代码生成和理解
SWE BENCH generation claude reasoning llm correct swe gym 1500 plus critic qwen code 14b
AI 模型这是一个专注于软件工程(SWE)任务的专业代码生成模型,旨在解决实际的 GitHub Issue 级别问题。它在 SWE-bench 等严苛的基准测试中表现出色,结合了 Claude 的推理能力与 Qwen-Code 1
Code Generation LLM LoRA Combined Model
AI 模型这是一个专门针对代码生成任务进行 LoRA 微调的组合模型。与通用大模型相比,它通过合并多个低秩适配器,强化了对编程语言语法和逻辑结构的理解。该模型旨在降低代码生成的随机性,提升代码的可用性和准确度。对于开发者而言,它非
falcon rw 1b code generation llm task2 modelC
AI 模型Falcon RW 1B 是一款轻量级的代码生成模型,专注于在极低资源占用下提供高效的编程辅助。对于中国开发者而言,这款模型最大的价值在于其极小的参数规模,非常适合部署在个人笔记本或边缘设备上,作为 IDE 插件的本地后
falcon code generation llm
AI 模型Falcon Code Generation 是一款基于 Apache-2.0 协议的开源代码大模型,专注于提升编程效率。它不仅能快速生成高质量的代码片段,还能在代码补全和逻辑重构方面提供有力支持。对于国内开发者而言,该
falcon rw 1b code generation llm task2
AI 模型Falcon RW 1B 是一款轻量级的代码生成模型,主打高效能与低资源占用。对于国内开发者而言,它最大的优势在于极小的参数量,这意味着你无需昂贵的 A100 集群,在普通的消费级显卡甚至部分高性能笔记本上即可流畅运行。
Code Generation LLM LoRA
AI 模型Code Generation LLM LoRA 是一个专门针对代码生成任务进行轻量化微调的适配器(LoRA)。与全参数模型不同,它通过在基础模型上叠加低秩矩阵,在保持原模型通用能力的同时,显著增强了对编程语法和逻辑结构
falcon code generation task llm
AI 模型Falcon Code Generation 是一款专注于代码生成的轻量级开源模型。它旨在通过对大量编程语言数据的预训练,帮助开发者快速实现从自然语言描述到可执行代码的转换。对于中国开发者而言,该模型非常适合集成到 ID
AI 模型 · 自然语言推理
查看全部 (10)mDeBERTa v3 base xnli multilingual nli 2mil7
AI 模型这是一个基于 mDeBERTa-v3 的多语言自然语言推理(NLI)微调模型。简单来说,它擅长判断两段文本之间的逻辑关系:是相互蕴含、矛盾还是无关。相比于通用大模型,这类判别式模型体积小、推理快,非常适合部署在端侧或作为
nli mpnet base v2
AI 模型nli-mpnet-base-v2 是一款在自然语言推理(NLI)任务上微调过的经典文本向量模型。与通用模型不同,它擅长将句子转化为高质量的语义向量,能精准捕捉文本间的逻辑关系和语义相似度。对于开发者而言,它是构建 RA
nli deberta v3 small
AI 模型nli-deberta-v3-small 是一款轻量级的自然语言推理(NLI)模型,基于 DeBERTa-v3 架构。它专注于判断两段文本之间的逻辑关系(蕴含、矛盾或中立),在中文开发者常用的 RAG 流程中,它常被用作
bert base turkish cased mean nli stsb tr
AI 模型这是一个基于 BERT-base 架构并针对土耳其语深度优化的预训练模型。它在 NLI(自然语言推理)和 STSb(语义文本相似度)数据集上进行了微调,擅长处理文本之间的逻辑关系判断和相似度计算。对于需要处理土耳其语语料
nli deberta v3 base
AI 模型nli-deberta-v3-base 是一款专注于自然语言推理(NLI)的交叉编码器模型。与常见的向量嵌入模型不同,它通过将两个句子同时输入模型来判断彼此的逻辑关系(蕴含、矛盾或中立),因此在语义匹配的精度上远高于简单
bert base nli mean tokens
AI 模型这是一个基于 BERT-base 架构并经过自然语言推理(NLI)任务微调的轻量级语义向量模型。它通过对 Token 向量进行平均池化,将文本高效地转化为固定长度的稠密向量(Embedding)。与通用 BERT 不同,
nli MiniLM2 L6 H768
AI 模型nli MiniLM2 L6 H768 是一款轻量级的交叉编码器(Cross-Encoder),专门用于自然语言推理(NLI)任务。与常见的向量检索(Bi-Encoder)不同,它通过将两个句子同时输入模型来判断它们之间
nli deberta v3 xsmall
AI 模型nli-deberta-v3-xsmall 是一款轻量级的自然语言推理(NLI)模型,基于高效的 DeBERTa-v3 架构。它专注于判断两段文本之间的逻辑关系(蕴含、矛盾或中立),在中文开发者常用的 RAG 流程中,它
AI 模型 · 音频分类
查看全部 (10)clap htsat fused
AI 模型CLAP HTSAT Fused 是一款由 LAION 推出的音频分类模型,它通过融合 HTSAT 架构,显著增强了对复杂声音信号的表征能力。与传统的音频处理工具不同,它专注于将音频片段映射到语义空间,能够高效识别环境音
ast finetuned audioset 10 10 0.4593
AI 模型这是一个基于 AST (Audio Spectrogram Transformer) 架构并在 AudioSet 数据集上微调的音频分类模型。它将音频信号转化为频谱图,利用 Transformer 的全局注意力机制来识别
wav2vec2 large xlsr 53 gender recognition librispeech
AI 模型这是一个基于 Meta 的 wav2vec2-large-xlsr-53 预训练模型微调而来的性别识别工具。它利用了强大的跨语言语音表征能力,专门针对 LibriSpeech 数据集进行了优化,能够从音频片段中高效提取声
ced gguf
AI 模型Ced GGUF 是一款轻量级的音频分类模型,采用 GGUF 格式以优化在本地端侧的推理性能。它专注于音频信号的类别识别,适合需要快速部署在个人电脑或边缘设备上的开发者。由于采用了量化格式,它极大地降低了对内存的依赖,无
audiobox aesthetics
AI 模型Audiobox Aesthetics 是由 Meta (Facebook) 开发的一款专注于音频质量评估的分类模型。与传统的语音识别或生成模型不同,它更像是一个“音频品鉴师”,能够量化分析音频的听感质量、自然度及美学特
gender cls svm ecapa voxceleb
AI 模型这是一个基于 ECAPA-TDNN 架构并在 VoxCeleb 数据集上预训练的性别分类模型。它将语音识别中先进的声纹特征提取能力应用于性别判定,能够高效地从音频片段中分辨男女声。对于需要快速集成语音预处理流程的开发者来
voice gender classifier
AI 模型这是一个轻量级的音频分类模型,专注于通过语音特征自动识别说话者的性别。对于需要处理大量语音数据的开发者来说,它能快速实现性别标签的自动化标注,而无需人工听写。该模型上手门槛极低,非常适合集成到用户画像分析、智能客服分流或
hubert large speech emotion recognition russian dusha finetuned
AI 模型这是一个基于 HuBERT-Large 预训练模型、针对俄语语音情感识别(SER)进行微调的专项模型。它专注于从俄语语音片段中提取情绪特征,能够识别说话者的情感状态。对于需要处理俄语音频分析、智能客服情感监控或多语言语音
AI 模型 · 图文检索
查看全部 (10)clip vit base patch32
AI 模型CLIP ViT-B/32 是 OpenAI 推出的经典多模态模型,其核心能力是将图像和文本映射到同一个向量空间。对于开发者来说,它不再是简单的图像分类器,而是一个强大的“语义匹配机”。你可以用它实现以文搜图、自动为图片
clip vit large patch14
AI 模型CLIP ViT-L/14 是 OpenAI 推出的经典多模态预训练模型,其核心能力在于将图像和文本映射到同一个特征空间。对于开发者而言,它不像生成式 AI 那样直接产出图片,而是一个极其强大的“语义对齐”工具。它能精准
clip vit large patch14 336
AI 模型CLIP ViT-L/14@336 是 OpenAI 推出的经典视觉-语言预训练模型。它通过海量图文对学习,将图像和文本映射到同一个向量空间,从而实现精准的跨模态检索。相比标准版,该模型将输入分辨率提升至 336x336
CLIP ViT B 32 laion2B s34B b79K
AI 模型这是一个基于 CLIP 架构的视觉-语言预训练模型,由 LAION 社区在海量数据集上训练而成。它通过将图像和文本映射到同一个向量空间,实现了强大的跨模态检索能力。对于开发者来说,它不仅能用于精准的图文匹配,更是很多生成
fashion clip
AI 模型Fashion CLIP 是一款专门针对时尚领域优化的图文检索模型。不同于通用 CLIP 模型,它在海量时尚数据集上进行了微调,能够更精准地理解服装的材质、款式和细分风格。对于开发者而言,它非常适合用于构建电商平台的“以
CLIP convnext base w laion2B s13B b82K augreg
AI 模型这是一个基于 ConvNeXt 架构且在 LAION-2B 大规模数据集上预训练的 CLIP 视觉-语言模型。相比于主流的 ViT 架构,它采用了纯卷积网络来处理图像,在保持强大特征提取能力的同时,对不同分辨率的图像适配
clip vit base patch16
AI 模型CLIP ViT-B/16 是 OpenAI 推出的经典视觉-语言预训练模型,其核心能力在于将图像和文本映射到同一个语义向量空间。对于开发者而言,它不再是传统的图像分类器,而是一个强大的“语义对齐”工具。你可以用它实现无
tiny clip text 2
AI 模型Tiny CLIP Text 2 是一款轻量级的图像-文本检索模型,专注于将文本描述高效地转化为向量空间,以便与图像特征进行匹配。与参数量巨大的主流 CLIP 模型不同,它在保持核心语义对齐能力的同时,极大地降低了计算开
AI 模型 · image-generation
查看全部 (9)NL Diffusion Image GGUF
AI 模型NL Diffusion Image GGUF 是一个经过量化处理的图像生成模型,旨在降低运行 AI 绘画的硬件门槛。它采用了 GGUF 格式,这意味着开发者和爱好者可以使用 llama.cpp 等轻量化推理框架,在消费
diffusion models image
AI 模型这是一类基于扩散概率模型的图像生成技术,目前是 AI 绘画领域的主流基石。与早期的 GANs 不同,它通过模拟“加噪”与“去噪”的过程,能够生成细节极高、构图自然的图像。对于开发者而言,这类模型通常具有极强的可控性,支持
diffusion models image
AI 模型这是一个基于扩散模型(Diffusion Models)的通用图像生成模型。它能够将文本描述转化为高质量的视觉图像,在光影处理和构图细节上表现稳健。对于开发者而言,该模型采用 Apache-2.0 开源协议,部署灵活且无
stable diffusion trained on yujiro hanma images baki anime fun project
AI 模型这是一个基于 Stable Diffusion 微调的垂直领域模型,专门针对《刃牙》中的角色范马勇次郎进行了深度训练。它能精准捕捉该角色极具辨识度的夸张肌肉线条和霸气神情,解决了通用模型难以还原特定动漫画风的痛点。对于二
blip image2promt stable diffusion base
AI 模型这是一个基于 BLIP 视觉语言模型的小巧工具,专门用于将图片“反向翻译”为 Stable Diffusion 可识别的提示词(Prompt)。很多开发者在尝试 AI 绘画时,常面临‘心中有图但写不出词’的痛点,该模型正
Medical X ray image generation stable diffusion
AI 模型这是一个基于 Stable Diffusion 微调的医学 X 光图像生成模型。它将通用图像生成的强大能力迁移到了医疗影像领域,能够根据文本描述合成具有医学特征的 X 光片。对于医疗 AI 开发者而言,它解决了医学数据脱
stable diffusion finetuned
AI 模型这是一个基于 Stable Diffusion 微调的图像生成模型,由 ImageInception 提供。相比于原版 SD,微调版本通常在特定风格的稳定性、光影细节或构图能力上有所增强,旨在降低用户通过复杂 Promp
stable diffusion base 2.0 text to image 04
AI 模型Stable Diffusion v2.0 是一个经典的开源文本生成图像模型。相比 1.5 版本,它在图像分辨率和细节刻画上有了显著提升,能够生成更具现代感和清晰度的画面。对于中国开发者而言,它最大的价值在于其强大的生态
AI 模型 · 文本生成音频
查看全部 (8)Ace Step1.5
AI 模型Ace Step1.5 是一款专注于文本到音频生成的开源模型,旨在为开发者提供更灵活的音频合成方案。不同于传统的 TTS(语音合成),它更强调对音频质感和环境氛围的还原。该模型采用 MIT 协议,意味着开发者可以低成本地
Ace Step1.5 XL DF11 ComfyUI
AI 模型Ace Step1.5 XL DF11 是一款专为 ComfyUI 生态设计的文本转音频(Text-to-Audio)模型。它将高质量的音频生成能力集成到了节点式工作流中,让开发者能够像控制图像生成一样,通过精准的参数调
fastspeech2 conformer
AI 模型FastSpeech2 Conformer 是由 ESPnet 提供的文本转语音(TTS)模型,它在 FastSpeech2 的非自回归架构基础上引入了 Conformer 模块,通过结合卷积和自注意力机制,显著提升了对
acestep 5Hz lm 4B
AI 模型acestep 5Hz lm 4B 是一款由 ACE-Step 推出的轻量级文本转音频(Text-to-Audio)模型。与传统的 TTS 语音合成不同,它更侧重于从文本描述直接生成丰富的音频片段或环境音效。4B 的参数
fastspeech2 conformer with hifigan
AI 模型这是一个由 ESPnet 提供的端到端语音合成方案,结合了 FastSpeech 2 的非自回归架构、Conformer 的上下文建模能力以及 HiFi-GAN 的高保真声码器。相比传统的 TTS 模型,它在保证语音自然
MiniMax Music3
AI 模型MiniMax Music3 是一款由 MiniMax 推出的文本生成音频模型,专注于将文字描述直接转化为高质量的音乐片段。它打破了传统音乐创作的高门槛,用户无需掌握乐理或复杂的 DAW 软件,只需通过自然语言描述风格、
acestep 5Hz lm 0.6B
AI 模型acestep 5Hz lm 0.6B 是一款轻量级的文本转音频(Text-to-Audio)模型。尽管参数量仅为 0.6B,但其设计目标是在保持极低推理开销的同时,实现高效的音频生成。对于中国开发者而言,该模型最大的吸
acestep v15 xl sft
AI 模型acestep v15 xl sft 是一款基于 MIT 协议开源的文本转音频(Text-to-Audio)模型。不同于简单的语音合成,它更侧重于通过自然语言描述生成高质量的音频片段或音效。对于开发者而言,该模型在 SF
AI 模型 · 图片生成视频
查看全部 (7)Wan2.2 I2V A14B GGUF
AI 模型Wan2.2 I2V A14B GGUF 是一个基于量化技术的图生视频模型。它将原本庞大的 A14B 参数规模通过 GGUF 格式进行压缩,极大地降低了显存门槛,让个人开发者在消费级显卡上也能跑起高质量的视频生成。该模型
Minimax h3 Turbo
AI 模型Minimax h3 Turbo 是一款主打高效能的图生视频(Image-to-Video)模型。它能够精准解析静态图片的细节,将其转化为动态流畅的短视频,在保持画面一致性的同时,显著提升了生成速度。对于国内开发者和内容
Wan2.2 Distill Loras
AI 模型Wan2.2 Distill Loras 是一组针对 Wan2.2 视频生成模型进行蒸馏优化后的 LoRA 权重,旨在通过轻量化插件的方式,在不损失过多画质的前提下,显著提升视频生成的推理速度并降低显存占用。对于国内开发
LTX2.3 10Eros
AI 模型LTX2.3 10Eros 是一款由 TenStrip 提供的图像转视频(Image-to-Video)模型。它专注于将静态图片转化为具有流畅动态效果的短视频,能够较好地保持原图的视觉一致性,避免了常见的画面闪烁或形变问
Wan2.2 I2V A14B Diffusers
AI 模型Wan2.2 I2V A14B 是一款由 Wan-AI 推出的高性能图生视频模型,现已集成至 Diffusers 库,极大降低了开发者的部署门槛。该模型主打对图像细节的精准还原与动态演化的自然度,能够将静态图片转化为高质
MiniMax H3 encoder GGUF
AI 模型MiniMax H3 encoder GGUF 是由 MiniMax 开发的图像编码器量化版本,专门为图像转视频(Image-to-Video)任务设计。它在视觉特征提取方面表现强劲,能将静态图像转化为模型可理解的高维表
Wan2.1 I2V 14B 480P gguf
AI 模型Wan2.1 I2V 14B 480P GGUF 是一个高性能的图生视频模型量化版。它旨在将静态图片转化为流畅的短视频,14B 的参数量保证了对复杂指令的理解力和画面的动态稳定性。得益于 GGUF 格式的优化,该模型显著
AI 模型 · 视觉分割
查看全部 (7)clipseg rd64 refined
AI 模型CLIPSeg RD64 Refined 是一款基于 CLIP 视觉语言预训练模型的图像分割工具。与传统的需要预定义类别的分割模型不同,它支持“零样本(Zero-shot)”分割,这意味着用户可以直接输入自然语言描述(如
BiRefNet
AI 模型BiRefNet 是一款专注于高质量图像背景去除(抠图)的深度学习模型。与传统的分割模型不同,它在处理物体边缘(如发丝、半透明材质)时表现极其细腻,能够有效避免粗糙的锯齿感。对于开发者而言,该模型上手门槛低,非常适合集成
segformer b0 finetuned ade 512 512
AI 模型SegFormer-B0 是一个轻量级的语义分割模型,该版本经过 ADE20K 数据集微调,支持 512x512 分辨率输入。它将 Transformer 的全局感知能力与分层结构相结合,有效解决了传统 CNN 在分割任
face parsing
AI 模型Face Parsing 是一款专注于人脸语义分割的图像处理模型。它能将人脸图像中的不同区域(如眼睛、眉毛、嘴唇、皮肤等)进行像素级的精准拆分和标注。对于开发者而言,它解决了人脸分析中“粗粒度”到“细粒度”的跨越,非常适
oneformer cityscapes swin large
AI 模型OneFormer Cityscapes Swin-L 是一款基于 Swin Transformer 架构的高性能图像分割模型,专门在 Cityscapes 城市街景数据集上进行了深度优化。它打破了传统语义分割、实例分割
coco panoptic eomt large 640
AI 模型coco panoptic eomt large 640 是一款专注于全景分割(Panoptic Segmentation)的图像处理模型。它将实例分割(区分个体)与语义分割(识别背景)相结合,能够一次性完成对画面中所有
modnet
AI 模型MODNet 是一款专注于实时人像抠图(Portrait Matting)的轻量级图像分割模型。与传统的背景移除工具不同,它在处理发丝、透明边缘等细节时更加细腻,且推理速度极快。由于其参数量小且运行效率高,非常适合集成到
AI 模型 · 光学字符识别
查看全部 (6)chandra ocr 2
AI 模型Chandra OCR 2 是一款专注于高精度文本识别的 OCR 模型,旨在解决复杂场景下的文档数字化问题。与传统的 OCR 工具相比,它在处理非结构化布局、低质量扫描件以及多语言混合排版时表现出更强的鲁棒性。对于开发者
DeepSeek OCR
AI 模型DeepSeek OCR 是一款由 DeepSeek 推出的高性能文档识别模型,旨在将图像中的文本精准转化为结构化数据。不同于传统的 OCR 仅做文字识别,它更强调对复杂排版、表格以及文档结构的深度理解,能够有效处理扫描
surya ocr 2
AI 模型Surya OCR 2 是一款专注于高精度文档解析的开源 OCR 引擎。与传统 OCR 仅识别文字不同,它在版面分析(Layout Analysis)和多语言识别上表现出色,能精准处理复杂的 PDF、扫描件及多栏排版文档
DeepSeek OCR 2
AI 模型DeepSeek OCR 2 是一款专注于高精度文档数字化和图像文本识别的模型。与传统 OCR 仅能识别文字不同,它更强调对文档结构(如表格、公式、排版)的深度理解,能够将复杂的扫描件或图片直接转化为结构化的可编辑文本。
Unlimited OCR AWQ
AI 模型Unlimited OCR AWQ 是一款经过量化优化的 OCR 视觉模型,旨在解决传统 OCR 在处理复杂布局、长文本或低质量图像时的识别瓶颈。该模型采用了 AWQ 量化技术,极大降低了显存占用并提升了推理速度,使得开
GOT OCR2 0
AI 模型GOT-OCR2.0 是由阶跃星辰(Stepfun)推出的通用 OCR 模型,旨在打破传统 OCR 仅能识别文字的局限。它不仅能精准提取文档文字,还能处理复杂的数学公式、化学方程式以及图表中的结构化数据。对于开发者而言,
AI 模型 · 情感分析
查看全部 (4)sentiment analysis fine tuned model
AI 模型这是一个专门针对情感分析(Sentiment Analysis)进行微调的轻量化模型。与通用大模型相比,它摒弃了冗余的对话能力,专注于将文本精准分类为正向、负向或中立情感。对于开发者而言,该模型非常适合集成到自动化客服分
twitter roberta base sentiment
AI 模型twitter-roberta-base-sentiment 是由卡迪夫大学开发的轻量级情感分析模型。它在 RoBERTa 基础上,利用大规模推特语料进行了专门的领域微调,因此对社交媒体中常见的口语化表达、俚语及非正式语
Bangla twoclass Sentiment Analyzer
AI 模型这是一个专门针对孟加拉语(Bangla)设计的轻量级二分类情感分析模型。它能够快速将文本识别为正面或负面情绪,非常适合需要处理南亚市场数据、进行跨境电商评论分析或社交媒体舆情监控的开发者。该模型采用 MIT 许可,部署门
rubert base cased sentiment rusentiment
AI 模型这是一个基于 RuBERT-base-cased 构建的俄语情感分析模型,专门针对 RuSentiment 数据集进行了微调。它能够精准识别俄语文本中的情感极性,是处理俄语社交媒体评论、用户反馈或市场调研数据的理想选择。
AI 模型 · 多模态表征
查看全部 (4)ChestVision Fine Tuned Vision Language Model
AI 模型ChestVision 是一款专门针对胸部 X 光影像微调的视觉语言模型(VLM)。它将计算机视觉与自然语言处理相结合,旨在将医学影像转化为可理解的文本描述。对于开发者而言,该模型解决了通用视觉模型在医学专业领域“看不准
Touch Vision Language Models
AI 模型Touch Vision Language Models 是一类专注于将触觉感知与视觉语言理解相结合的多模态表示模型。不同于纯视觉模型,它旨在让 AI 能够“感知”物理世界的材质、压力和纹理,将触觉信号转化为模型可理解的
vision language garment model
AI 模型这是一个专注于服装领域的视觉语言多模态表示模型。它不同于通用的 VLM,而是深耕于时尚与服饰细分场景,旨在将服装的视觉特征与文本描述进行精准对齐。对于需要开发电商搜索、智能穿搭推荐或服装自动化打标的开发者来说,该模型提供
vision language model
AI 模型这是一个基于 MIT 协议开源的多模态视觉语言模型(VLM),旨在打破文本与图像之间的壁垒。它能够像人类一样“阅读”图片并理解其中的语义信息,将视觉特征高效地映射到语言空间。对于开发者而言,该模型适合用于构建图像描述生成
AI 模型 · 视觉评价
查看全部 (3)generated image quality assessment
AI 模型这是一个专注于生成图像质量评估的轻量化模型,旨在解决 AI 绘图(如 Stable Diffusion 或 Midjourney)中常见的伪影、失真等质量判定问题。与传统的图像识别模型不同,它更像是一个“数字质检员”,能
face image quality assessment ediffiqa
AI 模型EdiffIQA 是一款由 OpenCV 提供的轻量级人脸图像质量评估模型。它主要解决的是在人脸识别、美颜或身份验证等实际业务场景中,如何快速筛选出“可用”照片的问题。该模型能客观量化人脸图像的清晰度、光照和质量得分,帮
AAL Plus Image Quality Assessment
AI 模型AAL Plus 是一款专注于图像质量客观评估的轻量化模型。与传统的视觉模型不同,它不负责生成图像,而是充当“评审员”,通过量化指标对图片的清晰度、噪点及伪影进行打分。对于经常使用 Stable Diffusion 或
AI 模型 · 文本生成
查看全部 (3)GPT-4
AI 模型最强大的 GPT 模型,适用于复杂任务
Claude 3.5 Sonnet
AI 模型具有卓越推理能力的先进 AI 助手
Gemini 1.5 Pro
AI 模型支持长上下文的多模态 AI
AI 模型 · 音频处理
查看全部 (1)Whisper Large V3
AI 模型强大的语音识别模型
AI 技能 · 通用
查看全部 (366)面试官
AI 技能I want you to act as an interviewer. I will be the candidate and you will ask me the interview questions for t
旅行指南
AI 技能I want you to act as a travel guide. I will write you my location and you will suggest a place to visit near m
查重工具
AI 技能I want you to act as a plagiarism checker. I will write you sentences and you will only reply undetected in pl
角色
AI 技能I want you to act like {character} from {series}. I want you to respond and answer like {character} using the
广告主
AI 技能I want you to act as an advertiser. You will create a campaign to promote a product or service of your choice.
讲述者
AI 技能I want you to act as a storyteller. You will come up with entertaining stories that are engaging, imaginative
足球解说员
AI 技能I want you to act as a football commentator. I will give you descriptions of football matches in progress and
单口喜剧演员
AI 技能I want you to act as a stand-up comedian. I will provide you with some topics related to current events and yo
AI 技能 · 编程
查看全部 (284)代码审查员
AI 技能审查代码中的错误、安全问题和最佳实践
以太坊开发者
AI 技能Imagine you are an experienced Ethereum developer tasked with creating a smart contract for a blockchain messe
Linux 终端
AI 技能I want you to act as a linux terminal. I will type commands and you will reply with what the terminal should s
JavaScript 控制台
AI 技能I want you to act as a javascript console. I will type commands and you will reply with what the javascript co
Excel 工作表
AI 技能I want you to act as a text based excel. you'll only reply me the text-based 10 rows excel sheet with row numb
UX/UI 开发工程师
AI 技能I want you to act as a UX/UI developer. I will provide some details about the design of an app, website or oth
网络安全专家
AI 技能I want you to act as a cyber security specialist. I will provide some specific information about how data is s
网页设计顾问
AI 技能I want you to act as a web design consultant. I will provide you with details related to an organization needi
AI 技能 · 数据
查看全部 (53)广告活动分析器
AI 技能分析跨渠道活动数据,量化不确定性,并提出带有证据标签的预算测试方案,避免过度解读因果关系。
Alpha Vantage
AI 技能获取 20 多年全球金融数据:涵盖股票、期权、外汇、加密货币、大宗商品、经济指标以及 50 多项技术指标。
分析追踪
AI 技能搭建、审计并调试分析跟踪实施方案 —— 涵盖 GA4、Google Tag Manager (GTM)、事件分类法、转化跟踪及数据质量。适用于从零开始制定跟踪计划、审计现有分析方案以查找缺失或错误、调试丢失事件或配置 G
Angular UI 模式
AI 技能用于加载状态、错误处理和数据展示的现代 Angular UI 模式。适用于构建 UI 组件、处理异步数据或管理组件状态。
反逆向工程技术
AI 技能仅限授权使用:本技能包含双用途安全技术。在进行任何绕过或分析之前:> 1.
Apify 受众分析
AI 技能深入分析 Facebook、Instagram、YouTube 和 TikTok 用户的受众人口统计特征、偏好、行为模式及互动质量。
Apify 电商解决方案
AI 技能使用 Apify 的电子商务抓取工具,从任何电商平台提取产品数据、价格、评论和卖家信息。
Apify 市场调研
AI 技能分析 Google Maps、Facebook、Instagram、Booking.com 和 TripAdvisor 上的市场状况、地理机会、定价、消费者行为及产品验证。
AI 技能 · 商业
查看全部 (41)营销专家
AI 技能创建营销策略和广告文案
招聘人员
AI 技能I want you to act as a recruiter. I will provide some information about job openings, and it will be your job
创业点子生成器
AI 技能Generate digital startup ideas based on the wish of the people. For example, when I say "I wish there's a big
销售员
AI 技能I want you to act as a salesperson. Try to market something to me, but make what you're trying to market look
初创科技律师
AI 技能I will ask of you to prepare a 1 page draft of a design partner agreement between a tech startup with IP and a
产品经理
AI 技能Please acknowledge my following request. Please respond to me as a product manager. I will ask for subject, an
内部沟通
AI 技能一套资源库,旨在帮助我按照公司偏好的格式撰写各类内部沟通文档。每当被要求撰写内部沟通内容(如状态报告、领导层更新、第三方更新、公司时事通讯、常见问题解答、事故报告等)时,Claude 都应调用此技能。
Slack GIF 生成器
AI 技能用于创建 Slack 优化动画 GIF 的知识与工具集。提供约束条件、验证工具及动画概念。适用于用户请求为 Slack 制作动画 GIF 的场景(例如:“帮我做一个 X 在做 Y 的 Slack GIF”)。
AI 技能 · 设计
查看全部 (41)提示词生成器
AI 技能I want you to act as a prompt generator. Firstly, I will give you a title like this: "Act as an English Pronun
数字艺术馆指南
AI 技能I want you to act as a digital art gallery guide. You will be responsible for curating virtual exhibits, resea
Midjourney 提示词生成器
AI 技能I want you to act as a prompt generator for Midjourney's artificial intelligence program. Your job is to provi
ChatGPT 提示词生成器
AI 技能I want you to act as a ChatGPT prompt generator, I will send a topic, you have to generate a ChatGPT prompt ba
品牌指南
AI 技能将 Anthropic 的官方品牌色彩和字体应用于任何需要体现其视觉风格的产出物。适用于需要遵循品牌色彩、风格指南、视觉格式或公司设计标准的场景。
画布设计
AI 技能运用设计哲学,创作 .png 和 .pdf 格式的精美视觉艺术作品。当用户要求创建海报、艺术品、设计方案或其他静态作品时,应使用此技能。创作原创视觉设计,绝不抄袭现有艺术家的作品,以避免版权冲突。
前端设计
AI 技能在构建新 UI 或重塑现有 UI 时,旨在打造具有辨识度且有意识的视觉设计的指南。旨在提供美学方向和排版指导,帮助你做出摆脱“模板化默认感”的设计选择。
主题工厂
AI 技能一套用于为交付物(Artifacts)应用主题样式的工具集。这些交付物可以是幻灯片、文档、报告、HTML 落地页等。该工具集提供 10 种预设的颜色和字体主题,可应用于任何已创建的交付物,同时也支持实时生成新主题。
AI 技能 · 写作
查看全部 (30)编剧
AI 技能I want you to act as a screenwriter. You will develop an engaging and creative script for either a feature len
诗人
AI 技能I want you to act as a poet. You will create poems that evoke emotions and have the power to stir people's sou
论文写作助手
AI 技能I want you to act as an essay writer. You will need to research a given topic, formulate a thesis statement, a
记者
AI 技能I want you to act as a journalist. You will report on breaking news, write feature stories and opinion pieces,
文档协同编辑
AI 技能引导用户通过结构化工作流共同撰写文档。适用于用户想要编写文档、提案、技术规范、决策文档或类似结构化内容时。该工作流旨在帮助用户高效地传递上下文、通过迭代完善内容并验证文档。
Word 文档
AI 技能每当用户想要创建、读取、编辑或操作 Word 文档(.docx 文件)或 Word 模板(.dotx 文件)时,请使用此技能。触发条件包括:提及“Word doc”、“word document”、“.docx”、“.d
由于 "adhx" 不是一个标准的通用英文单词或广泛认可的技术缩写,它可能是特定上下文中的专有名词或拼写错误。 如果它是 **ADHD** 的误写,翻译为:**注意力缺陷多动障碍**。 如果它是某个特定系统的缩写,请提供更多上下文。
AI 技能将任何 X/Twitter 帖子获取为简洁且 LLM 友好的 JSON 格式。支持将 x.com、twitter.com 或 adhx.com 链接转换为包含完整文章内容、作者信息和互动指标的结构化数据。无需爬虫或浏览器
文章插图
AI 技能使用 Grav 角色 IP 生成 16:9 的手绘风格文章插图,要求标注简洁,视觉隐喻荒诞且清晰。
AI 技能 · Office
查看全部 (10)便携式文档格式 (PDF)
AI 技能每当用户需要处理 PDF 文件时,请使用此技能。具体包括:阅读或提取 PDF 中的文本/表格、合并多个 PDF、拆分 PDF、旋转页面、添加水印、创建新 PDF、填写 PDF 表单、加密/解密 PDF 等。
PPT 演示文稿
AI 技能只要涉及 .pptx 或 .potx 文件(无论是作为输入、输出或两者兼有),请随时使用此技能。这包括:创建幻灯片、路演 PPT 或演示文稿;以及读取、解析或从任何 .pptx 或 .potx 文件中提取文本(即使提取的
Excel 工作簿 (.xlsx)
AI 技能每当电子表格文件是主要输入或输出时,请使用此技能。这意味着任何用户希望执行以下操作的任务:打开、读取、编辑或修复现有的 .xlsx, .xlsm, .xltx, .csv 或 .tsv 文件(例如:添加列、计算公式、格式
Azure AI 翻译文档 Python SDK
AI 技能Azure AI 文档翻译 SDK 可用于文档的批量翻译并保留原格式。适用于大规模翻译 Word、PDF、Excel、PowerPoint 及其他文档格式。
考证准备
AI 技能针对对抗性场景(而非友好场景)的董事会会议准备。其核心在于:对数据的绝对掌控、预判尖锐问题,并构建一套既能承认弱点又不失掌控力的叙事逻辑。适用于准备董事会会议、投资者更新、融资演示或任何高压汇报场景。
合同与提案撰写人
AI 技能生成专业且符合司法管辖要求的商业文档:包括自由职业合同、项目提案、工作说明书 (SOW)、保密协议 (NDA) 和主服务协议 (MSA)。采用结构化 Markdown 输出,并提供 docx 转换指南。涵盖美国(特拉华州
演示视频
AI 技能适用于用户请求根据截图或场景描述创建演示视频、产品导览、功能展示、动画演示、营销视频或 GIF 的场景。该功能通过编排 playwright、ffmpeg 和 edge-tts MCP 来生成高质量的视频内容。
Markdown 幻灯片
AI 技能将 Markdown 幻灯片(通过 `---` 水平线或 `# ` 一级标题分隔,并支持可选的 `<!-- notes: ... -->` 演讲者备注块)转换为单个 HTML 演示文件。该文件支持方向键 / 空格 / P
AI 技能 · 教育
查看全部 (8)励志教练
AI 技能I want you to act as a motivational coach. I will provide you with some information about someone's goals and
辩论教练
AI 技能I want you to act as a debate coach. I will provide you with a team of debaters and the motion for their upcom
情感教练
AI 技能I want you to act as a relationship coach. I will provide some details about the two people involved in a conf
AI 写作导师
AI 技能I want you to act as an AI writing tutor. I will provide you with a student who needs help improving their wri
人生教练
AI 技能I want you to act as a life coach. I will provide some details about my current situation and goals, and it wi
学校教师
AI 技能I want you to act as an instructor in a school, teaching algorithms to beginners. You will provide code exampl
公众演讲教练
AI 技能I want you to act as a public speaking coach. You will develop clear communication strategies, provide profess
人才教练
AI 技能I want you to act as a Talent Coach for interviews. I will give you a job title and you'll suggest what should
AI 技能 · 翻译
查看全部 (6)英文翻译与优化助手
AI 技能I want you to act as an English translator, spelling corrector and improver. I will speak to you in any langua
英语发音助手
AI 技能I want you to act as an English pronunciation assistant for ${Mother Language:Turkish} speaking people. I will
英语口语教师与提升专家
AI 技能I want you to act as a spoken English teacher and improver. I will speak to you in English and you will reply
新语言创建者
AI 技能I want you to translate the sentences I wrote into a new made up language. I will write the sentence, and you
语言检测器
AI 技能I want you act as a language detector. I will type a sentence in any language and you will answer me in which
Speech-Language Pathologist (SLP)
AI 技能I want you to act as a speech-language pathologist (SLP) and come up with new speech patterns, communication s
AI 技能 · 营销
查看全部 (1)SEO 优化师
AI 技能为搜索引擎优化内容
MCP 工具 · 通用
查看全部 (29)jdubois/azure-cli-mcp
MCP 工具Azure CLI 命令行封装工具,可让你直接与 Azure 交互。
nwiizo/tfmcp
MCP 工具🦀 🏠 - A Terraform MCP server allowing AI assistants to manage and operate Terraform environments, enabling r
automateyournetwork/pyATS_MCP
MCP 工具Cisco pyATS server enabling structured, model-driven interaction with network devices.
maxim-saplin/mcp_safe_local_python_executor(一个安全的本地 Python 执行器 MCP 服务)
MCP 工具Safe Python interpreter based on HF Smolagents `LocalPythonExecutor`
sonirico/mcp-shell
MCP 工具🏎️ 🏠 🍎 🪟 🐧 Give hands to AI. MCP server to run shell commands securely, auditably, and on demand on isola
tumf/mcp-shell-server
MCP 工具A secure shell command execution server implementing the Model Context Protocol (MCP)
areweai/tsgram-mcp
MCP 工具TSgram: Telegram + Claude with local workspace access on your phone in typescript. Read, write, and vibe code
teddyzxcv/ntfy-mcp
MCP 工具通过 ntfy 向手机发送通知以保持信息同步的 MCP 服务器。
MCP 工具 · 网络
查看全部 (16)thinkchainai/mcpbundles
MCP 工具MCP Bundles: Create custom bundles of tools and connect providers with OAuth or API keys. Use one MCP server a
microsoft/playwright-mcp
MCP 工具Official Microsoft Playwright MCP server, enabling LLMs to interact with web pages through structured accessib
hashicorp/terraform-mcp-服务器
MCP 工具🎖️🏎️☁️ - The official Terraform MCP Server seamlessly integrates with the Terraform ecosystem, enabling prov
sawa-zen/vrchat-mcp
MCP 工具📇 🏠 This is an MCP server for interacting with the VRChat API. You can retrieve information about friends, w
saurabhsharma2u/search-console-mcp
MCP 工具一个用于与 Google Search Console 和 Bing Webmasters 交互的 MCP 服务器。
OpenZeppelin 合约生成向导
MCP 工具A Model Context Protocol (MCP) server that allows AI agents to generate secure smart contracts in multiples la
apiarya/wemo-mcp-server
MCP 工具[](https:
hbg/mcp-paperswithcode
MCP 工具🐍 ☁️ MCP to search through PapersWithCode API
MCP 工具 · 数据库
查看全部 (11)mindsdb/mindsdb
MCP 工具Connect and unify data across various platforms and databases with [MindsDB as a single MCP server](https://do
Aiven-Open/mcp-aiven
MCP 工具🐍 ☁️ 🎖️ - Navigate your [Aiven projects](https://go.aiven.io/mcp-server) and interact with the PostgreSQL®,
alexanderzuev/supabase-mcp-server
MCP 工具支持 SQL 查询执行和数据库探索工具的 Supabase MCP 服务器
bram2w/baserow
MCP 工具Baserow database integration with table search, list, and row create, read, update, and delete capabilities.
planetscale/mcp
MCP 工具PlanetScale CLI 包含一个 MCP 服务器,可让 AI 工具直接访问您的 PlanetScale 数据库。
longportapp/openapi
MCP 工具🐍 ☁️ - LongPort OpenAPI provides real-time stock market data, provides AI access analysis and trading capabil
traceloop/opentelemetry-mcp-服务器
MCP 工具🐍🏠 - An MCP server for connecting to any OpenTelemetry backend (Datadog, Grafana, Dynatrace, Traceloop, etc.
thinkchainai/agentinterviews_mcp
MCP 工具Conduct AI-powered qualitative research interviews and surveys at scale with [Agent Interviews](https://agenti
MCP 工具 · 文件系统
查看全部 (6)finmap-org/mcp-server
MCP 工具[finmap.org](https://finmap.org/) MCP server provides comprehensive historical data from the US, UK, Russian a
urlbox/urlbox-mcp-server
MCP 工具📇 🏠 A reliable MCP server for generating and managing screenshots, PDFs, and videos, performing AI-powered s
Azure/azure-mcp
MCP 工具Official Microsoft MCP server for Azure services including Storage, Cosmos DB, and Azure Monitor.
mediar-ai/screenpipe
MCP 工具🎖️ 🦀 🏠 🍎 Local-first system capturing screen/audio with timestamped indexing, SQL/embedding storage, seman
MonadsAG/capsulecrm-mcp
MCP 工具📇 ☁️ Allows AI clients to manage contacts, opportunities and tasks in Capsule CRM including Claude Desktop re
MCP 文件系统
MCP 工具为 Claude 提供安全的文件系统访问
MCP 工具 · 搜索
查看全部 (3)andybrandt/mcp-simple-arxiv
MCP 工具🐍 ☁️ MCP for LLM to search and read papers from arXiv
andybrandt/mcp-simple-pubmed
MCP 工具🐍 ☁️ MCP to search and read medical / life sciences papers from PubMed.
tan-yong-sheng/ai-vision-mcp
MCP 工具📇 🏠 🍎 🪟 🐧 - Multimodal AI vision MCP server for image, video, and object detection analysis. Enables UI/U
MCP 工具 · 开发
查看全部 (1)TamarEngel/jira-github-mcp
MCP 工具MCP server that integrates Jira and GitHub to automate end-to-end developer workflows, from issue tracking to