SD百科导航
  • 首页
  • 快讯
  • 早报
  • 模型
  • ComfyUI
  • 新技术
  • 百科
    • 教程
    • 硬件
    • 科普
  • 百科工具
    • 工具
  • 排行榜
  • 网址提交
    • 首页
    • 快讯
    • 早报
    • 模型
    • ComfyUI
    • 新技术
    • 百科
      • 教程
      • 硬件
      • 科普
    • 百科工具
      • 工具
    • 排行榜
    • 网址提交

    百科

    共 2620 篇文章
    百科工具模型ComfyUIAI合集web UI提示词
    教程新技术硬件科普早报
    排序
    发布更新浏览点赞
    新型蒸馏技术iCD:提升文本引导的图像编辑任务中的图像生成和编辑能力

    新型蒸馏技术iCD:提升文本引导的图像编辑任务中的图像生成和编辑能力

    俄罗斯Yandex Research和高等经济大学的研究人员推出新型蒸馏技术Invertible Consistency Distillation(iCD),它用于提升文本引导的图像编辑任务中的图像生...
    新技术# iCD# 蒸馏技术
    2年前
    05980
    图像修补任务Reflecting Reality:专门用于创建逼真的镜面反射

    图像修补任务Reflecting Reality:专门用于创建逼真的镜面反射

    印度理工学院班加罗尔分校视觉与人工智能实验室、三星印度研发中心和牛津大学视觉几何组的研究人员推出Reflecting Reality,它专门用于创建逼真的镜面反射。简单来说,可以处理给定的图片,自动在...
    新技术# Reflecting Reality# 镜面反射
    2年前
    05970
    苹果推出新型图像生成模型Kaleido Diffusion:通过整合自回归的潜在先验来增强采样的图像多样性

    苹果推出新型图像生成模型Kaleido Diffusion:通过整合自回归的潜在先验来增强采样的图像多样性

    苹果和弗吉尼亚理工大学的研究人员推出新型图像生成模型Kaleido Diffusion,此模型旨在通过自回归潜在模型(autoregressive latent modeling)提高扩散模型(dif...
    新技术# Kaleido Diffusion# 图像生成模型# 苹果
    2年前
    05970
    DeepSeek R1 模型完成小版本升级!官方依旧选择开源,DeepSeek-R1-0528已上线Hugging Face

    DeepSeek R1 模型完成小版本升级!官方依旧选择开源,DeepSeek-R1-0528已上线Hugging Face

    昨晚,DeepSeek 官方在交流群中宣布:DeepSeek R1 已完成小版本升级(代号:R1-0528),用户现已可通过官方网页、App 和小程序体验(记得开启“深度思考”模式),API 接口与使...
    早报# DeepSeek-R1# DeepSeek-R1-0528
    11个月前
    05950
    MiniMax 发布其首个文本到图像生成模型 Image-01

    MiniMax 发布其首个文本到图像生成模型 Image-01

    MiniMax 近日正式发布了其首个文本到图像生成模型 Image-01,标志着其在多模态视觉领域的重大突破。Image-01 不仅扩展了 MiniMax 的 AI 功能,还为全球用户带来了极具创意和...
    早报# Image-01# MiniMax# 图像生成模型
    1年前
    05950
    MVideo:用于生成具有精确、流畅动作的长时视频

    MVideo:用于生成具有精确、流畅动作的长时视频

    无限光年、上海交通大学和复旦大学的研究人员推出新型框架MVideo,它专门设计用于生成具有精确、流畅动作的长时视频。MVideo通过结合文本提示和掩码序列(mask sequences)作为额外的运动...
    新技术# MVideo# 文生视频
    1年前
    05950
    统一Transformer模型Show-o:同时处理多模态理解(如图像和文本)和生成任务

    统一Transformer模型Show-o:同时处理多模态理解(如图像和文本)和生成任务

    新加坡国立大学和字节跳动的研究人员推出一种统一的Transformer模型Show-o,,它统一了多模态的理解和生成。不同于完全自回归模型,Show-o结合了自回归和(离散)扩散建模,以自适应地处理各...
    新技术# Show-o# Transformer模型
    2年前
    05940
    大型多模态模型VideoGLaMM:专为用户提供的文本输入进行视频中细粒度像素级定位而设计

    大型多模态模型VideoGLaMM:专为用户提供的文本输入进行视频中细粒度像素级定位而设计

    视频与文本之间的细粒度对齐是一个具有挑战性的问题,因为视频中存在复杂的空间和时间动态。现有的基于视频的大型多模态模型(LMMs)虽然可以处理基本对话,但在视频中进行精确的像素级定位方面存在困难。 大型...
    新技术# VideoGLaMM# 大型多模态模型
    1年前
    05930
    字节推出TextToon:在实时环境中将真人的头像转换成卡通化的形象

    字节推出TextToon:在实时环境中将真人的头像转换成卡通化的形象

    罗切斯特大学和字节跳动的研究人员推出TextToon,它能够在实时环境中将真人的头像转换成卡通化的形象。就像魔法一样,这项技术可以把你从视频中的头像变成你想要的任何卡通风格,比如美国漫画风格、皮克斯动...
    新技术# TextToon# 字节跳动
    2年前
    05930
    创新系统SEE-2-SOUND:为静态图片或动态视频生成与之匹配的立体声效果,增强观众的沉浸感和体验

    创新系统SEE-2-SOUND:为静态图片或动态视频生成与之匹配的立体声效果,增强观众的沉浸感和体验

    多伦多大学、Temerty 人工智能研究与医学教育中心和Sunnybrook 研究所的研究人员推出创新系统SEE-2-SOUND,它能够将视觉内容(如图片或视频)转换成具有空间感的音频输出。简单来说...
    新技术# SEE-2-SOUND# 立体声
    2年前
    05930
    DiLightNet:用于文生图模型图像生成过程中对照明效果精细控制

    DiLightNet:用于文生图模型图像生成过程中对照明效果精细控制

    来自浙江大学、微软亚洲研究院、威廉玛丽学院和清华大学的研究人员提出一种新方法DiLightNet,它用于在基于文本提示的扩散模型图像生成过程中实现精细的照明控制。 论文地址 扩散模型是一种能够根据文本...
    新技术# DiLightNet# 照明效果
    2年前
    05930
    LM Arena 被指控操纵 AI 基准测试,缺乏公正性和透明性

    LM Arena 被指控操纵 AI 基准测试,缺乏公正性和透明性

    一项由 Cohere、斯坦福大学、麻省理工学院和 Ai2 研究人员联合发布的新研究,指责热门 AI 基准测试平台 LM Arena(Chatbot Arena 的背后组织)帮助少数顶级 AI 实验室通...
    早报# LM Arena
    11个月前
    05920
    加载更多
    SD百科导航
    SD百科导航是专注于AI创作领域的专业导航网站。我们全面涵盖Stable Diffusion、Flux、AI绘画、AI视频、AI音乐以及大语言模型等前沿内容。

    关于我们网址提交友链申请广告合作

    扫码关注微信公众号SD百科导航
    扫码关注微信公众号
    Copyright © 2026 SD百科导航 皖ICP备18025588号-5  皖公网安备34040002000401 
    网址
    网址文章软件模型

    网址

    日榜周榜月榜
    S.H.I.T

    S.H.I.T

    在主流学术界为顶刊版面、高影响因子和“非升即走”的考核指标疯狂内卷之时,一场名为“学术垃圾”的反叛运动正在角落里悄然兴起。一群“想开了”的硕博研究生和青年学者(青椒),不再试图迎合传统的学术评价体系,而是隆重推出了一系列名字惊世骇俗的“旗舰”期刊——《SHIT》、《Notrue》、《Silence》、《Crazy》。
    诗一

    诗一

    诗一收录超过 34 万首中国古诗词,涵盖唐诗、宋词、诗经、楚辞、古文观止等经典合集。所有内容均可在线免费阅读、搜索与赏析。
    Claude Managed Agents

    新Claude Managed Agents

    Claude Managed Agents是一组可用于大规模构建和部署智能体程序的API。它预先配置好了所需的各项功能:原生MCP接口、各种工具集成方案、内存资源等。无论您是要创建单任务处理程序,还是构建复杂的多智能体系统,都能轻松实现快速开发与部署。
    即梦 CLI

    即梦 CLI

    即梦 CLI (Jimeng CLI) 是字节跳动官方推出的面向 AI Agent 的命令行工具包。它打破了图形界面的限制,让任何 AI 智能体(如基于 OpenClaw 的助手)都能直接调用即梦强大的 Seedance 2.0 旗舰模型,实现图片与视频的自动化生成。
    ITELLOU

    ITELLOU

    ITELLYOU(也称为NEXT, ITELLYOU)是一个专注于提供微软原版软件资源的非官方网站,主要帮助用户获取未经修改的微软产品镜像,如Windows操作系统、Office办公软件和开发工具等。
    waoo

    waoo

    waoowaoo AI 影视 Studio 是一款基于 AI 技术的短剧/漫画视频制作工具,支持从小说文本自动生成分镜、角色、场景,并制作成完整视频。
    查看完整榜单