图像模型

百科工具模型 ComfyUI AI合集 web UI 提示词

大语言模型多模态模型图像模型语音模型 3D模型 Flux衍生视频模型世界模型

排序

发布更新浏览点赞

腾讯混元项目组联合北京大学提出新框架MixGRPO：用混合微分方程提升图像对齐效率

在图像生成领域，如何让模型输出更符合人类审美与偏好，已成为对齐研究的核心目标。基于流匹配（Flow Matching）的生成模型近年来展现出强大潜力，而 Group Relative Policy O...

图像模型 # MixGRPO

6个月前

03040

黑森林实验室联合 KREA AI 发布 FLUX.1 Krea [dev]：实现更真实、更自然的图像生成

黑森林实验室（Black Forest Labs, BFL）与创意 AI 平台 KREA AI 正式宣布推出 FLUX.1 Krea [dev] —— 一个全新的开源文本到图像生成模型，也是 Krea...

6个月前

05350

腾讯混元提出 X-Omni：用强化学习突破离散自回归图像生成瓶颈

在当前多模态生成模型的发展中，研究者始终在探索一个统一的建模范式：能否用类似语言模型“预测下一个词”的方式，来生成图像？这种被称为“下一令牌预测（next-token prediction）”的自回归...

图像模型 # X-Omni # 腾讯混元

6个月前

03720

Anzhc 开源系列 YOLO 模型：专注细粒度图像分割与分类任务

在图像检测与分割领域，高质量的专用模型往往能显著提升下游任务的表现。开发者 Anzhc 基于自建标注数据集，训练并开源了一系列面向特定视觉任务的 YOLO 模型，涵盖面部、眼部、头部、胸部等细粒度目标...

图像模型 # YOLO 模型 # 图像分割

6个月前

04690

南洋理工大学 S-Lab 提出新型对象移除框架ObjectClear ，精准消除物体及其阴影、反射

在图像编辑任务中，移除一个物体看似简单，实则极具挑战。不仅要将目标对象从画面中“擦除”，还需同步清除其带来的视觉副产物——如阴影、倒影、高光、遮挡痕迹等。若处理不当，即便主体消失，残留的影子或反光仍...

图像模型 # ObjectClear # 南洋理工大学 # 对象移除

6个月前

03650

RouWei-Gemma：基于 Gemma-3-1b 的文本编码器适配器（用于 Rouwei 0.8）

RouWei-Gemma是一个为 Rouwei 0.8 开发的文本编码器适配器，基于 Gemma-3-1b 构建，用于替换 SDXL 中的 CLIP 文本编码器。它利用大语言模型（LLM）的强大语义理...

图像模型 # Gemma-3-1b # Rouwei 0.8 # RouWei-Gemma

7个月前

02830

字节跳动 & 复旦大学联合提出智能海报生成新框架 DreamPoster

在 AI 生成图像（AIGC）领域，海报设计一直是极具挑战性的任务之一。它不仅要求模型理解文本描述，还需要兼顾视觉美感、排版逻辑和品牌一致性。近日，字节跳动与复旦大学的研究团队联合提出了一种新的文本...

图像模型 # DreamPoster # 字节跳动 # 海报设计

7个月前

03350

T-LoRA：基于时间步敏感机制的扩散模型个性化定制方法

在图像生成任务中，扩散模型凭借强大的表达能力成为主流方案。然而，在仅有一张图像作为训练样本的情况下，模型容易出现过拟合现象，导致生成结果过度依赖原始图像背景或姿态，而无法很好地响应文本提示。为此，研...

图像模型 # T-LoRA

7个月前

01080

NovelAI 正式公开了其基于SD1.5的第二代图像生成模型 NovelAI Diffusion V2

NovelAI 正式公开了其第二代图像生成模型 NovelAI Diffusion V2 的权重文件，供研究、个人使用及历史保存。这一举动意味着即使该模型在 NovelAI 官网停止服务后，用户仍可通...

图像模型 # NovelAI Diffusion V2 # SD1.5

7个月前

03230

阿里Ovis团队发布统一多模态模型Ovis-U1：理解、生成与编辑三位一体

近日，阿里巴巴通义实验室Ovis团队正式发布了新一代统一多模态大模型——Ovis-U1。该模型以30亿参数为基础，实现了对多模态任务的全面覆盖，涵盖图像理解、文本到图像生成以及图像编辑三大核心能力。 ...

图像模型 # Ovis-U1 # 统一多模态模型

7个月前

02320

BRIA AI 推出 Bria 3.2：专为商业设计的下一代文本到图像模型

BRIA AI 正式发布其最新文本到图像模型 Bria 3.2。作为一款专为企业和商业应用打造的生成模型，Bria 3.2 凭借仅 40 亿参数的轻量架构，在美学效果与文本渲染能力方面表现优异，经评...

图像模型 # Bria 3.2 # BRIA AI

7个月前

01560

字节跳动提出的新一代多主体可控图像生成模型XVerse

在文本到图像生成领域，如何实现对多个主体身份和语义属性（如姿势、风格、照明）的细粒度控制，同时保持高质量和一致性，一直是一个极具挑战性的问题。传统方法往往存在以下问题：在多主体场景中容易引入视觉伪...

图像模型 # XVerse # 图像生成模型

7个月前

03630

加载更多

腾讯混元项目组联合北京大学提出新框架MixGRPO：用混合微分方程提升图像对齐效率

黑森林实验室联合 KREA AI 发布 FLUX.1 Krea [dev]：实现更真实、更自然的图像生成

腾讯混元提出 X-Omni：用强化学习突破离散自回归图像生成瓶颈

Anzhc 开源系列 YOLO 模型：专注细粒度图像分割与分类任务

南洋理工大学 S-Lab 提出新型对象移除框架ObjectClear ，精准消除物体及其阴影、反射

RouWei-Gemma：基于 Gemma-3-1b 的文本编码器适配器（用于 Rouwei 0.8）

字节跳动 & 复旦大学联合提出智能海报生成新框架 DreamPoster

T-LoRA：基于时间步敏感机制的扩散模型个性化定制方法

NovelAI 正式公开了其基于SD1.5的第二代图像生成模型 NovelAI Diffusion V2

阿里Ovis团队发布统一多模态模型Ovis-U1：理解、生成与编辑三位一体

BRIA AI 推出 Bria 3.2：专为商业设计的下一代文本到图像模型

字节跳动提出的新一代多主体可控图像生成模型XVerse

Clawdbot/Moltbot

新QoderWork

Situation Monitor

Higgsfield AI

CutCut

ITELLOU

图像模型

网址

Clawdbot/Moltbot

新QoderWork

Situation Monitor

Higgsfield AI

CutCut

ITELLOU