模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

music generation model GGUF

apache-2.0
这款由 mradermacher 提供的音乐生成模型 GGUF 版本,旨在让开发者在消费级硬件上也能高效运行音频生成任务。通过 GGUF 格式的量化优化,它极大降低了显存占用,解决了原模型对算力要求过高的问题。对于希望在本地部署音乐 AI、...
mradermacher 音频生成
393 0

distilgpt2 abc irish music generation

apache-2.0
这是一个基于 DistilGPT-2 架构微调的轻量级音频生成模型,专注于爱尔兰传统音乐的创作。它将音乐转化为类文本的序列进行学习,能够生成具有爱尔兰民乐风格的旋律。由于采用了蒸馏模型,该模型对计算资源要求极低,非常适合开发者在本地环境快速...
ehcalabres 音频生成
153 0

music generation

apache-2.0
这是一个基于 Apache-2.0 开源协议的音频生成模型,旨在将文本描述转化为高质量的音乐片段。与复杂的专业编曲软件不同,它降低了音乐创作的门槛,开发者可以通过 API 快速将其集成到短视频背景音乐生成、游戏动态音效或个性化铃声等应用场景...
DancingIguana 音频生成
100 0

Sinhala Audio to Text

Apache-2.0
这是一个专注于僧伽罗语(Sinhala)语音识别的专项模型。对于需要处理斯里兰卡当地语言数据的开发者来说,它解决了通用大模型在小众语种上识别率低、丢词严重的痛点。该模型将音频直接转化为文本,非常适合用于构建当地语言的会议记录、客服质检或多语...
AqeelShafy7 音频生成
41 0

LongCat AudioDiT 3.5B tts text to speech SOTA

mit
LongCat AudioDiT 3.5B 是一款基于扩散变换器(DiT)架构的 SOTA 级文本转语音模型。与传统的 TTS 方案不同,它在音频生成的自然度和情感表达上有了显著提升,能够有效避免机械感。该模型在处理长文本和复杂语调时表现稳...
9r4n4y 音频生成
26 0

LongCat AudioDiT 3.5B tts text to speech SOTA

mit
LongCat AudioDiT 3.5B 是一款基于扩散变换器(DiT)架构的高质量语音合成模型。它突破了传统 TTS 机械感强的问题,能够生成极具自然度和情感起伏的音频,在音质和韵律上达到了 SOTA 水平。对于开发者而言,该模型在处理...
orbitalhd 音频生成
19 0

GPT2 Music Generation Trained

mit
这是一个基于 GPT-2 架构微调的音频生成模型,将原本处理文本的 Transformer 能力迁移到了音乐创作上。它通过学习音乐序列的概率分布,能够根据给定的前奏或风格引导,自动补全或生成一段旋律。对于开发者而言,它提供了一个轻量级的音乐...
hardikpatel 音频生成
11 0

music generation

mit
这是一个基于 MIT 协议的开源音乐生成模型,旨在将文本描述直接转化为音频片段。对于国内开发者而言,它提供了一个轻量级的音频创作方案,能够快速生成背景音乐或短音频素材,无需复杂的编曲知识即可上手。相比于 Suno 或 Udio 等闭源商业工...
metoonhathung 音频生成
11 0

music generation model

apache-2.0
这是一个基于 Apache-2.0 开源协议的音乐生成模型,旨在为开发者提供灵活的音频创作能力。与常见的商业音乐 AI 不同,它更侧重于通过模型权重实现可定制的音乐合成,适合需要将音频生成能力集成到自有应用中的开发者。无论是为短视频制作背景...
nagayama0706 音频生成
8 0

swahili asr audio to text

Apache-2.0
这是一个专注于斯瓦希里语(Swahili)的语音转文字(ASR)模型。对于需要处理东非地区语言数据的开发者来说,它提供了一个轻量级的解决方案。该模型上手门槛低,主要用于将斯瓦希里语语音流转换为文本,适用于构建多语言客服机器人、翻译工具或当地...
Peed911 音频生成
8 0

saad speech recognition hausa audio to text

apache-2.0
这是一个专注于豪萨语(Hausa)的语音识别模型,旨在将该语言的音频高效转换为文本。对于需要处理西非地区语言数据的开发者或研究者来说,它填补了通用大模型在小众语种识别精度上的空白。该模型采用 Apache-2.0 开源协议,上手门槛较低,可...
Baghdad99 音频生成
8 0

music generation

mit
这是一个基于 MIT 协议开源的轻量级音乐生成模型,旨在为开发者提供低门槛的音频创作能力。不同于复杂的专业编曲软件,该模型侧重于快速生成短片段音乐,非常适合集成到独立游戏、短视频配乐或简单的 AI 创意应用中。由于其开源属性,开发者可以轻松...
lopushanskyy 音频生成
6 0

AudioSangraha Audio to Text

apache-2.0
AudioSangraha 是一款轻量级的语音转文字(ASR)工具,旨在将音频高效地转换为文本。对于中国开发者而言,它提供了一个基于 Apache-2.0 协议的开源方案,非常适合集成到个人项目或企业内部的自动化工作流中。相比于重量级的商业...
AqeelShafy7 音频生成
6 0

Sinhala Audio to Text CD

apache-2.0
Sinhala Audio to Text CD 是一款专注于僧伽罗语(斯里兰卡官方语言)的语音转文字模型。对于需要处理南亚小众语种的开发者来说,它解决了通用模型在特定方言和口音上识别率低的问题。该模型上手门槛较低,适合集成到自动化转录工作...
AqeelShafy7 音频生成
6 0

LongCat AudioDiT 3.5B tts text to speech SOTA

mit
LongCat AudioDiT 是一款基于 Diffusion Transformer 架构的 SOTA 级语音合成模型。与传统的 TTS 方案相比,它在音色自然度和情感表达上有了显著提升,能够有效避免机械感,生成更具“人味”的音频。该模...
kkjipndy 音频生成
6 0

audio to texto pt br

apache-2.0
这是一个专门针对葡萄牙语(巴西)设计的语音转文本工具。与通用型的大模型不同,它专注于特定语种的音频识别,能够更精准地处理巴西葡萄牙语的口音和语境。对于需要处理葡语会议记录、访谈素材或进行多语言内容迁移的开发者来说,这是一个轻量且高效的预处理...
handsonbrain 音频生成
5 0

whisper audio to text

Apache-2.0
Whisper 是一款由 OpenAI 开源、目前被公认为工业级标杆的语音转文字模型。它通过在大规模多语言数据集上进行训练,实现了极强的鲁棒性,即使在背景噪音较大或口音较重的情况下,也能提供极高准确率的转录和翻译。对于开发者而言,它不仅支持...
AventIQ-AI 音频生成
5 0