多模态模型

排序

发布更新浏览点赞

阿里通义实验室发布新一代端到端多模态旗舰模型Qwen2.5-Omni

阿里通义实验室发布了 Qwen2.5-Omni，这是 Qwen 模型家族中的新一代端到端多模态旗舰模型。Qwen2.5-Omni 专为全方位多模态感知设计，能够无缝处理文本、图像、音频和视频等多种输入...

10个月前

02630

阿里巴巴 Qwen 推出紧凑型多模态模型 Qwen3-VL 4B/8B，支持 FP8 低显存部署

阿里巴巴通义千问（Qwen）团队于 2025 年 10 月 15 日正式发布 Qwen3-VL 4B 与 8B 两款稠密视觉语言模型，每款均提供指令版（Instruction）与思维版（Reas...

多模态模型 # Qwen3-VL 4B # Qwen3-VL 8B # 多模态模型

4个月前

02620

多模态模型RoboBrain：让机器人从抽象指令到具体操作的多模态大脑

近年来，多模态大语言模型（MLLMs）在多种场景中展现了卓越的能力，但在机器人领域，尤其是在长时段复杂操作任务中，其表现仍存在显著局限性。这些局限主要源于当前 MLLMs 缺乏三种关键能力：规划能力...

多模态模型 # RoboBrain # 多模态模型 # 机器人

9个月前

02400

新型统一多模态模型家族 BLIP3-o：同时支持图像理解和图像生成任务

Salesforce、马里兰大学、弗吉尼亚理工大学、纽约大学、华盛顿大学和加州大学戴维斯分校的研究人员推出新型统一多模态模型家族 BLIP3-o ，同时支持图像理解和图像生成任务。多模态模型是指能够处...

多模态模型 # BLIP3-o # 多模态模型

9个月前

02290

字节跳动推出多模态模型Vidi：专门用于视频理解和编辑

字节跳动推出多模态模型Vidi，专门用于视频理解和编辑。Vidi 的主要目标是支持高质量、大规模视频内容的创作，通过处理原始输入材料（如未编辑的视频片段）和编辑组件（如视觉效果），帮助用户更高效地完成...

多模态模型 # Vidi # 多模态模型 # 字节跳动

9个月前

02130

中国团队推出 Lumina-DiMOO：支持生成与理解的全能多模态模型

由上海人工智能实验室牵头，联合上海创智学院、上海交通大学、悉尼大学、南京大学、香港中文大学和清华大学的研究团队，共同推出 Lumina-DiMOO ——一个面向多模态生成与理解一体化的新型基础模型。 ...

图像模型 # Lumina-DiMOO # 多模态模型

5个月前

02110

Thyme：会生成代码的多模态模型，突破“图像思考”边界

由快手联合中科院自动化所、南京大学、清华大学、中国科学技术大学共同研发的Thyme，重新定义了视觉多模态模型的能力边界。它不再局限于传统的“用图像思考”，而是通过自主生成、执行代码，完成多样化的图像处...

多模态模型 # Thyme # 多模态模型

5个月前

01180

IBM 推出 Granite Docling：专为文档转换优化的轻量级多模态模型

IBM Research 正式发布 Granite Docling-258M，一款基于 IDEFICS3 架构构建的新型多模态图像-文本到文本模型，专为高效、准确的文档理解与结构化转换而设计。 Git...

多模态模型 # Granite Docling-258M # 多模态模型 # 文档转换

4个月前

0880

没有了

阿里通义实验室发布新一代端到端多模态旗舰模型Qwen2.5-Omni

阿里巴巴 Qwen 推出紧凑型多模态模型 Qwen3-VL 4B/8B，支持 FP8 低显存部署

多模态模型RoboBrain：让机器人从抽象指令到具体操作的多模态大脑

新型统一多模态模型家族 BLIP3-o：同时支持图像理解和图像生成任务

字节跳动推出多模态模型Vidi：专门用于视频理解和编辑

中国团队推出 Lumina-DiMOO：支持生成与理解的全能多模态模型

Thyme：会生成代码的多模态模型，突破“图像思考”边界

IBM 推出 Granite Docling：专为文档转换优化的轻量级多模态模型

Clawdbot/Moltbot

Skills.sh

Situation Monitor

CutCut

Fogsight (雾象)

新Awesome Clawdbot(Moltbot) Skills

多模态模型

网址

Clawdbot/Moltbot

Skills.sh

Situation Monitor

CutCut

Fogsight (雾象)

新Awesome Clawdbot(Moltbot) Skills