视频模型

百科工具模型 ComfyUI AI合集 web UI 提示词

大语言模型多模态模型图像模型语音模型 3D模型 Flux衍生视频模型世界模型

排序

发布更新浏览点赞

Spatia：基于可更新空间记忆的长期一致视频生成框架

传统视频生成模型在生成长视频时，常因高维时空信号的复杂性而难以维持长期的空间与时间一致性——场景结构漂移、物体位置突变、相机运动不连贯等问题普遍存在。项目主页：https://zhaojingjin...

视频模型 # Spatia # 视频生成

3个月前

0330

英伟达推出NitroGen：基于人类游戏视频的通用视觉-动作基础模型

NitroGen 是由英伟达开发的开放性具身智能基础模型（foundation model for embodied agents），旨在通过观察人类玩家的游戏视频，直接学习从原始画面到手柄动作的映射...

视频模型 # NitroGen # 英伟达

3个月前

0840

FlashPortrait：端到端生成无限长度肖像动画，6倍加速且身份一致

在肖像动画（Portrait Animation）任务中，身份一致性与推理效率是两大长期瓶颈。现有扩散模型即便能生成逼真短片，也常在长序列中出现身份漂移、颜色偏移或动作断裂，且生成速度慢，难以用于实际...

视频模型 # FlashPortrait # 肖像动画

3个月前

0980

美团 LongCat 发布统一音频驱动视频模型LongCat-Video-Avatar：支持长视频、多模态输入与多人物动画

音频驱动的人类视频合成（Audio-Driven Talking Head）近年来在唇形同步和画面逼真度上取得显著进展。但生成长时间、高动态、身份一致的视频仍是行业难题：现有方法要么在长序列中出现身份...

视频模型 # LongCat-Video-Avatar # 美团

3个月前

0480

PersonaLive：基于扩散模型的实时肖像动画系统，延迟仅0.25秒

在数字人、虚拟主播和直播场景中，高质量、低延迟、身份一致的肖像动画是核心需求。然而，主流扩散模型虽能生成逼真画面，却因高计算成本与多步去噪，难以满足实时交互要求——生成一段3秒视频往往需要数十秒，远不...

视频模型 # PersonaLive # 肖像动画

3个月前

0220

MoLingo：通过语义对齐潜在空间实现高保真文本到动作生成

在虚拟角色动画、VR/AR交互和智能体控制中，如何让AI根据一句自然语言（如“一个人正在跳华尔兹”）生成逼真、连贯且语义一致的人体动作，一直是核心挑战。传统方法要么动作生硬，要么与文本描述脱节，难以兼...

视频模型 # MoLingo # 动作生成

3个月前

01060

智谱AI发布 Kaleido：通过多参考图像生成主体一致视频的 S2V 框架

在主体到视频（Subject-to-Video, S2V）生成任务中，目标是根据用户提供的多张目标主体参考图像和文本提示，合成一段主体身份一致、动作自然、背景可控的视频。尽管近期 S2V 模型取得进展...

视频模型 # Kaleido # 智谱AI

4个月前

0700

智谱AI提出 SSVAE：通过谱结构优化提升视频VAE“可扩散性”的新方法

在基于扩散模型的视频生成系统中，视频变分自编码器（VAE）扮演着关键角色：它将像素空间视频压缩到潜在空间，供扩散模型高效训练。然而，现有视频 VAE 的设计往往过度聚焦于重建保真度，却忽视了一个更根...

视频模型 # SSVAE # 智谱AI

4个月前

0210

智谱AI发布面向生产级角色动画的生成框架 SCAIL：通过3D一致姿态表征实现影棚级角色动画

高质量角色动画长期以来依赖昂贵的动作捕捉设备、繁琐的手动绑定和大量人力修型。尽管近年视频生成模型取得进展，但在复杂动作、风格化角色、多角色交互等场景下，现有方法仍普遍存在结构失真、时间不连贯、身份泄漏...

视频模型 # SCAIL # 智谱AI # 角色动画

4个月前

0790

智谱AI开源 RealVideo：基于自回归扩散的实时流式对话视频系统

随着多模态生成技术的发展，用户对虚拟角色的期待已从“能说话”升级为“能自然表达、实时互动、持续存在”。为此，智谱AI推出了 RealVideo —— 一个端到端实时流式视频对话系统，能够将文本对话实时...

视频模型 # RealVideo # 数字人 # 智谱AI

4个月前

01930

AnyTalker：用单人数据生成自然互动的多人对话视频

多人对话视频的自动生成，长期以来受限于两个关键难题：一是高质量多人视频数据极难获取，二是多个角色之间的互动行为难以建模。为解决这些问题，来自香港科技大学、Video Rebirth、浙江大学和北京交通...

视频模型 # AnyTalker

4个月前

0220

巨人网络AI实验室推出YingVideo-MV：音乐驱动的多阶段视频生成框架，让 AI 会“演”一首歌

巨人网络AI实验室推出 YingVideo-MV，这是一个用于音乐驱动的多阶段视频生成框架，能够从音频信号中自动生成高质量的音乐表演视频。YingVideo-MV 集成了音频语义分析、可解释的镜头规划...

视频模型 # YingVideo-MV

4个月前

0210

加载更多

Spatia：基于可更新空间记忆的长期一致视频生成框架

英伟达推出NitroGen：基于人类游戏视频的通用视觉-动作基础模型

FlashPortrait：端到端生成无限长度肖像动画，6倍加速且身份一致

美团 LongCat 发布统一音频驱动视频模型LongCat-Video-Avatar：支持长视频、多模态输入与多人物动画

PersonaLive：基于扩散模型的实时肖像动画系统，延迟仅0.25秒

MoLingo：通过语义对齐潜在空间实现高保真文本到动作生成

智谱AI发布 Kaleido：通过多参考图像生成主体一致视频的 S2V 框架

智谱AI提出 SSVAE：通过谱结构优化提升视频VAE“可扩散性”的新方法

智谱AI发布面向生产级角色动画的生成框架 SCAIL：通过3D一致姿态表征实现影棚级角色动画

智谱AI开源 RealVideo：基于自回归扩散的实时流式对话视频系统

AnyTalker：用单人数据生成自然互动的多人对话视频

巨人网络AI实验室推出YingVideo-MV：音乐驱动的多阶段视频生成框架，让 AI 会“演”一首歌

S.H.I.T

ITELLOU

TapNow

CC-Connect

OpenMAIC

Qwen Chat

视频模型

网址

S.H.I.T

ITELLOU

TapNow

CC-Connect

OpenMAIC

Qwen Chat