语音模型

百科工具模型 ComfyUI AI合集 web UI 提示词

大语言模型多模态模型图像模型语音模型 3D模型 Flux衍生视频模型世界模型

排序

发布更新浏览点赞

新通义千问开源 Qwen3-ASR 与 Qwen3-ForcedAligner：支持流式、多语言、高并发的语音识别与对齐工具

Qwen（通义千问）团队正式开源全新一代语音技术方案——Qwen3-ASR系列语音识别模型与Qwen3-ForcedAligner强制对齐模型。该系列包含Qwen3-ASR-1.7B、Qwen3-AS...

9小时前

060

微软开源 VibeVoice-ASR：支持60分钟长音频的端到端语音转写模型

微软正式开源 VibeVoice-ASR——一款面向真实场景的统一语音识别模型。它能单次处理长达60分钟的连续音频，并输出包含说话人身份、精确时间戳与文本内容的结构化转录结果，同时支持用户注入自定义热...

语音模型 # VibeVoice-ASR # 微软

6天前

090

Qwen3-TTS 全家桶开源：支持音色克隆、创造与多语言拟人语音

在语音生成技术快速迭代的当下，开发者与用户对高保真、可定制、低延迟的语音合成方案需求日益迫切。阿里Qwen项目组推出的 Qwen3-TTS 开源全家桶，凭借音色克隆、音色创造、拟人化语音生成与自然语言...

语音模型 # Qwen3-TTS # 阿里

1周前

0710

英伟达推出实时语音对话模型PersonaPlex，打造支持自定义角色与声音的自然对话AI

长期以来，语音对话 AI 面临一个根本性矛盾：传统级联系统（ASR → LLM → TTS）允许你自定义角色和声音，但对话僵硬、延迟高、无法被打断；全双工模型（如 Moshi）实现了自然的话轮转换...

语音模型 # PersonaPlex # 实时语音对话模型 # 英伟达

1周前

0210

FlashLabs推出Chroma 1.0：首个开源实时语音对话模型，支持低延迟个性化语音克隆

在虚拟人交互与语音合成领域，兼顾低延迟、高保真语音克隆、多轮对话理解的模型一直是技术难点。由FlashLabs开发的 Chroma 1.0 正是一款突破性的多模态因果语言模型，它不仅能直接处理音频输入...

语音模型 # Chroma # FlashLabs # 实时语音对话模型

1周前

03620

HeartMuLa：开源音乐基础模型家族，支持歌词识别、高保真生成与细粒度控制

如果你曾幻想过——只需输入一段歌词和一句描述（如“一首欢快的流行歌，吉他伴奏，副歌要有电子音效”），AI 就能生成一首结构完整、音质高保真的歌曲——那么 HeartMuLa 项目正将这一愿景变为现实...

语音模型 # HeartMuLa # 音乐模型

1周前

01100

智谱AI开源GLM-TTS：LLM驱动的高质量TTS系统，支持零样本克隆与情感增强

智谱AI推出的GLM-TTS是一款基于大语言模型的文本到语音合成系统，创新性采用LLM+Flow模型的两阶段架构，不仅实现了零样本语音克隆、流式推理等实用功能，还通过多奖励强化学习框架，大幅提升了语音...

语音模型 # GLM-TTS # 智谱AI

2周前

0250

ElevenLabs 推出 Scribe v2：支持 90+ 语言的高精度批量转录模型

ElevenLabs 正式发布 Scribe v2——一款专为大规模音视频内容处理设计的新一代语音转文字模型。与主打低延迟的 Scribe v2 Realtime 不同，Scribe v2 面向批量转...

语音模型 # ElevenLabs # Scribe v2

3周前

0500

Nemotron-Speech-Streaming-En-0.6B：面向低延迟与高吞吐的流式语音识别模型

英伟达推出的 Nemotron-Speech-Streaming-En-0.6B 是 Nemotron Speech 系列中的首个统一语音识别（ASR）模型，专为实时英语转录场景设计。它同时支持低延迟...

语音模型 # Nemotron-Speech-Streaming-En-0.6B # 英伟达 # 语音识别

3周前

0150

通义百聆发布 Fun-Audio-Chat：8B 端到端语音模型，延迟更低、效率更高

通义实验室旗下语音团队通义百聆（Tongyi Bailin）正式推出 Fun-Audio-Chat —— 一款专为自然、低延迟语音交互设计的端到端大型音频语言模型（Audio Language Mo...

语音模型 # Fun-Audio-Chat # 通义百聆

1个月前

0220

Chatterbox-Turbo 发布：3.5 亿参数、一步解码、支持副语言标签的高效 TTS 模型

Resemble AI 正式开源 Chatterbox 系列——一个由三款高性能文本转语音（TTS）模型组成的开源 TTS 工具集，覆盖低延迟交互、多语言支持与创意语音控制三大典型场景。所有模型均支持...

语音模型 # Chatterbox-Turbo

1个月前

0310

Grok Voice Agent API 上线：支持多语言、实时工具调用与低延迟语音交互

xAI 正式推出 Grok Voice Agent API，向开发者开放其在 Grok 移动应用及特斯拉车载系统中使用的语音交互技术。该 API 支持构建能实时对话、调用工具、搜索网络并流利使用数十种...

语音模型 # Grok Voice Agent

1个月前

0210

加载更多

新通义千问开源 Qwen3-ASR 与 Qwen3-ForcedAligner：支持流式、多语言、高并发的语音识别与对齐工具

微软开源 VibeVoice-ASR：支持60分钟长音频的端到端语音转写模型

Qwen3-TTS 全家桶开源：支持音色克隆、创造与多语言拟人语音

英伟达推出实时语音对话模型PersonaPlex，打造支持自定义角色与声音的自然对话AI

FlashLabs推出Chroma 1.0：首个开源实时语音对话模型，支持低延迟个性化语音克隆

HeartMuLa：开源音乐基础模型家族，支持歌词识别、高保真生成与细粒度控制

智谱AI开源GLM-TTS：LLM驱动的高质量TTS系统，支持零样本克隆与情感增强

ElevenLabs 推出 Scribe v2：支持 90+ 语言的高精度批量转录模型

Nemotron-Speech-Streaming-En-0.6B：面向低延迟与高吞吐的流式语音识别模型

通义百聆发布 Fun-Audio-Chat：8B 端到端语音模型，延迟更低、效率更高

Chatterbox-Turbo 发布：3.5 亿参数、一步解码、支持副语言标签的高效 TTS 模型

Grok Voice Agent API 上线：支持多语言、实时工具调用与低延迟语音交互

Skills.sh

Situation Monitor

CutCut

TapNow

Clawdbot/Moltbot

火宝短剧（Huobao Drama）

语音模型

网址

Skills.sh

Situation Monitor

CutCut

TapNow

Clawdbot/Moltbot

火宝短剧（Huobao Drama）