文本转语音模型Kokoro-82M:8200万参数,支持多语言和多声音选项 Kokoro是一款先进的文本转语音(TTS)模型,以其精简的参数量和卓越的性能在众多竞争对手中脱颖而出。拥有8200万参数的Kokoro,其模型大小不超过300M,却能生成高质量的音频输出。特别值得一... 语音模型# Kokoro-82M# TTS 2周前03120
Playful Metropolis:融合了都市环境与卡通元素的插画风格Flux Lora Playful Metropolis是一款充满活力与创意的插画风格Flux Lora,融合了都市环境与充满想象力的卡通元素。这种风格通过将日常城市景观与夸张、有趣的角色和场景相结合,创造出一种超现实又... Flux衍生# Playful Metropolis 2周前0840
Propaganda Games:20 世纪中叶宣传海报风格Lora Propaganda Games是一款受英国标志性平面设计师阿布拉姆·盖姆斯 (1914-1996) 标志性风格启发的Flux Lora,此 LoRA 捕捉了 20 世纪中叶宣传海报的鲜明、震撼的美学... Flux衍生# Propaganda Games 2周前0890
肖像图像动画Hallo系列再次更新!Hallo3框架引入Cogvidex模型,生成的肖像动画动作更自然、画面更逼真 复旦大学、百度的研究人员对再次对Hallo 进行了更新,提出了 Hallo3框架,在通过预训练的基于变换器的视频生成模型(Cogvidex),解决现有肖像图像动画技术在处理非正面视角、渲染肖像周围动态... 视频模型# Cogvidex模型# Hallo3 2周前0890
Stability AI推出图生3D框架SPAR3D:从单张图片生成可编辑的 3D 模型 Stability AI和伊利诺伊大学厄巴纳-香槟分校的研究人员推出一个用于从单视图图像重建高质量3D对象的先进框架SPAR3D,SPAR3D通过结合回归模型和生成模型的优势,实现了高效的3D重建,同... 3D模型# 3D模型# SPAR3D# Stability AI 2周前0810
Adobe推出TransPixar:通过文本和图像生成透明背景的视频 香港科技大学(广州)和 Adobe 研究的研究人员推出一种先进的文本到视频生成方法 TransPixar,特别专注于生成包含透明度通道(Alpha Channel)的RGBA视频,也就是能够通过文... 视频模型# TransPixar 2周前0920
新型多模态大语言模型Sa2VA:将 SAM2 与 LLaVA相结合,实现对图像和视频的深入理解 加州大学默塞德分校、字节跳动、武汉大学和北京大学的研究人员推出新型多模态大语言模型Sa2VA,它将SAM-2视频分割模型与LLaVA视觉-语言模型相结合,实现了对图像和视频的密集、基于语义的理解。Sa... 多模态模型# Sa2VA# 多模态大语言模型 2周前01080
微软正式开源了Phi-4:拥有140亿参数的小型语言模型 去年12月,微软推出了其Phi系列的最新成员——Phi-4,该模型在解决数学问题等方面展现了显著的进步。这些进步主要得益于训练数据质量的提升,特别是采用了高质量的合成数据集和人类生成的内容数据集。然而... 大语言模型# Phi-4# 微软 2周前0770
高效大型多模态模型LLaVA-Mini:通过最小化视觉令牌(vision tokens)的数量来提高模型的计算效率和响应速度 中国科学院计算技术研究所智能信息处理重点实验室(ICT/CAS)、中国科学院人工智能安全重点实验室和中国科学院大学的研究人员推出高效大型多模态模型LLaVA-Mini,旨在通过最小化视觉令牌(visi... 多模态模型# LLaVA-Mini# 多模态模型 2周前0840
开源多模态视频语音大模型VITA-1.5: 基于Qwen2.5模型,实现接近实时的视觉和语音交互能力 随着多模态大语言模型(MLLMs)的发展,如何有效地整合视觉、语言和语音成为了人工智能领域面临的一个重要挑战。VITA-1.5 是由南京大学(NJU)、腾讯优图实验室(Tencent Youtu La... 语音模型# Qwen2.5模型# VITA-1.5 2周前01060
英伟达推出世界基础模型平台NVIDIA Cosmos :帮助物理 AI 开发人员更好、更快地构建物理 AI 系统 英伟达在CES2025上宣布推出 NVIDIA Cosmos 平台,该平台包含先进的世界基础生成模型、高级分词器、防护栏和加速视频处理管道,旨在推动自动驾驶汽车(AV)和机器人等物理 AI 系统的发展... 多模态模型# NVIDIA Cosmos# 世界模型# 英伟达 2周前01040
Anaglyph3D:生成3D图像的Flux Lora,不过需要你戴上红蓝 3D 眼镜观看 Anaglyph3D是一款能够让你生成3D图像的Flux Lora,不过需要你戴上红蓝 3D 眼镜观看,才能看到图像展现出的效果,红蓝3D眼睛很便宜,只需要几块钱就可以在网上买到。 模型地址:http... Flux衍生# Anaglyph3D# Flux LoRa 2周前01210