SD百科导航
  • 首页
  • 快讯
  • 早报
  • 模型
  • ComfyUI
  • 新技术
  • 百科
    • 教程
    • 硬件
    • 科普
  • 百科工具
    • 工具
  • 排行榜
  • 网址提交
    • 首页
    • 快讯
    • 早报
    • 模型
    • ComfyUI
    • 新技术
    • 百科
      • 教程
      • 硬件
      • 科普
    • 百科工具
      • 工具
    • 排行榜
    • 网址提交

    模型

    共 1055 篇文章
    百科工具模型ComfyUIAI合集web UI提示词
    大语言模型多模态模型图像模型语音模型3D模型Flux衍生视频模型
    排序
    发布更新浏览点赞
    微软推出全新多模态大语言模型家族Florence-VL

    微软推出全新多模态大语言模型家族Florence-VL

    马里兰大学和微软研究院的研究团队共同提出了Florence-VL,这是一个全新的多模态大语言模型(MLLMs)家族。Florence-VL的视觉表示由生成式视觉基础模型Florence-2生成,与传统...
    多模态模型# Florence-VL# 多模态大语言模型# 微软
    11个月前
    03110
    新颖3D生成模型TRELLIS:能够创建多功能且高质量的3D资产

    新颖3D生成模型TRELLIS:能够创建多功能且高质量的3D资产

    清华大学、中国科学技术大学和微软研究院的研究团队联合提出了一种名为TRELLIS的新颖3D生成模型,该模型能够创建多功能且高质量的3D资产。TRELLIS的核心优势在于其统一的结构化潜在表示(Stru...
    3D模型# 3D生成模型# TRELLIS
    11个月前
    04290
    谷歌推出开源视觉语言模型PaliGemma2:增加了强大的视觉能力,更容易微调

    谷歌推出开源视觉语言模型PaliGemma2:增加了强大的视觉能力,更容易微调

    今年5月,谷歌推出了 PaliGemma,这是 Gemma 家族中的第一个视觉语言模型,旨在使一流的视觉AI更加普及。现在,谷歌自豪地推出 PaliGemma 2,这是一个可调视觉语言模型的最新进化版...
    多模态模型# PaliGemma2# 视觉语言模型# 谷歌
    11个月前
    03060
    CogVideoXXX1.5-5B-I2V LoRA NSFW :基于 CogVideoX1.5-5B 的LoRA模型,专门针对NSFW内容进行了训练

    CogVideoXXX1.5-5B-I2V LoRA NSFW :基于 CogVideoX1.5-5B 的LoRA模型,专门针对NSFW内容进行了训练

    CogVideoXXX1.5-5B-I2V LoRA NSFW 是一个基于 CogVideoX1.5-5B 的LoRA模型,专门针对NSFW内容进行了训练。该模型在处理NSFW内容时表现出色,但也具备...
    视频模型# CogVideoX1.5-5B# LoRA模型
    11个月前
    03130
    TTS模型FishSpeech推出v1.5 版本:具备多语言支持、零样本即时语音克隆、低延迟等特性

    TTS模型FishSpeech推出v1.5 版本:具备多语言支持、零样本即时语音克隆、低延迟等特性

    FishSpeech v1.5 是一款功能强大的文本到语音(TTS)模型,具备多语言支持、零样本即时语音克隆、低延迟等特性。该模型拥有仅5亿参数,却能够在多种语言之间无缝切换,并提供高质量的语音合成效...
    语音模型# FishSpeech v1.5# TTS模型
    11个月前
    04790
    AWPortraitCN:专门针对中国人长相特征及审美进行了优化的FLUX LoRA模型

    AWPortraitCN:专门针对中国人长相特征及审美进行了优化的FLUX LoRA模型

    AWPortraitCN 是由 DynamicWang 基于FLUX.1-dev模型开发的一款LoRA模型,专门针对中国人长相特征及审美进行了优化。该模型使用了包含室内、室外人像、时尚、棚拍写真等多类...
    Flux衍生# AWPortraitCN# LoRA模型
    11个月前
    01,3440
    多功能即插即用适配器MV-Adapter:将SDXL模型及其衍生模型适配为多视图生成器。

    多功能即插即用适配器MV-Adapter:将SDXL模型及其衍生模型适配为多视图生成器。

    现有的多视图图像生成方法通常对预训练的文生图模型进行侵入性修改,并需要全面微调,导致高计算成本和图像质量下降。为了解决这些问题,北京航空航天大学、VAST 和上海交通大学的研究人员提出了 MV-Ada...
    图像模型# MV-Adapter# SDXL模型# 多视图
    11个月前
    03280
    SWITTI:用于文本到图像合成的新型规模感知变换器模型

    SWITTI:用于文本到图像合成的新型规模感知变换器模型

    Yandex Research、HSE 大学、MIPT 和 Skoltech 的研究人员提出了 Switti,这是一个专门设计用于文本到图像(T2I)生成的尺度变换器。Switti 从现有的下一尺度预...
    图像模型# SWITTI# 文生图模型
    11个月前
    02910
    开源视频生成项目Open-Sora Plan:基于多种用户输入生成高分辨率、长时长的理想视频

    开源视频生成项目Open-Sora Plan:基于多种用户输入生成高分辨率、长时长的理想视频

    由北大-兔展AIGC联合实验室共同发起的Open-Sora Plan,目标是复现OpenAI的Sora模型。这是一个开源的大型视频生成模型项目,旨在基于多种用户输入生成高分辨率、长时长的理想视频。该项...
    视频模型# Open-Sora Plan
    11个月前
    02760
    腾讯发布开源视频生成模型—混元文生视频模型HunyuanVideo

    腾讯发布开源视频生成模型—混元文生视频模型HunyuanVideo

    腾讯在今天正式开源了其最新的视频生成模型—混元文生视频模型HunyuanVideo。这款模型不仅在视频生成能力上与业界领先的闭源模型相匹敌,甚至在某些方面表现更为出色。作为一款综合性的框架,Hunyu...
    视频模型# HunyuanVideo# 混元文生视频模型# 腾讯
    11个月前
    04230
    InfiniteZoom-Mochi:基于视频生成模型Mochi的LoRA,专注于无限缩放艺术风格

    InfiniteZoom-Mochi:基于视频生成模型Mochi的LoRA,专注于无限缩放艺术风格

    InfiniteZoom-Mochi是一个视频生成模型Mochi的LoRA,专注于无限缩放艺术风格。无限缩放艺术风格是一种独特的视觉效果,通过不断放大图像的某个部分,创造出一种无限深入的感觉。应用此L...
    视频模型# InfiniteZoom-Mochi# 无限缩放
    11个月前
    02590
    10款Flux LoRA模型:提升Flux模型生成图像的质量和艺术性

    10款Flux LoRA模型:提升Flux模型生成图像的质量和艺术性

    虽然Flux模型非常强大,但大家想要更多风格、更高质量的图像,那么LoRA就非常必要了,通过整合特定的LoRA模型,您可以显著提升Flux模型生成图像的质量和艺术性。今天给大家分享10款LoRA模型...
    Flux衍生# FLUX模型# Lora
    11个月前
    03310
    加载更多
    SD百科导航
    SD百科导航是专注于AI创作领域的专业导航网站。我们全面涵盖Stable Diffusion、Flux、AI绘画、AI视频、AI音乐以及大语言模型等前沿内容。

    关于我们网址提交友链申请广告合作

    扫码关注微信公众号SD百科导航
    扫码关注微信公众号
    Copyright © 2026 SD百科导航 皖ICP备18025588号-5  皖公网安备34040002000401 
    网址
    网址文章软件模型

    网址

    日榜周榜月榜
    Fogsight (雾象)

    Fogsight (雾象)

    雾象是一款由大语言模型(LLM)驱动的动画引擎 agent 。用户输入抽象概念或词语,雾象会将其转化为高水平的生动动画。
     CutCut

     CutCut

    CutCut是一个视频下载与剪辑工具,支持从 YouTube、Bilibili 等主流平台直接按章节或自定义时间范围下载片段,无需先下完整视频再剪辑。
    ITELLOU

    ITELLOU

    ITELLYOU(也称为NEXT, ITELLYOU)是一个专注于提供微软原版软件资源的非官方网站,主要帮助用户获取未经修改的微软产品镜像,如Windows操作系统、Office办公软件和开发工具等。
    Tripo

    Tripo

    Tripo AI 是一家领先的 AI 驱动 3D 建模解决方案提供商,允许用户使用文本、单张图像、多张图像、涂鸦或视频等输入,快速创建高质量的 3D 模型和环境。
    互联网大厂模拟器

    互联网大厂模拟器

    《互联网大厂模拟器》或许不会改变现实,但它提供了一个出口:在虚拟世界里,我们可以安全地体验“另一种职场人生”,然后笑着关掉页面,继续面对明天的站会。
    人生 K 线

    人生 K 线

    人生 K 线(Life Destiny K-Line)是一个结合传统八字命理与现代大语言模型(LLM)的轻量级可视化工具。它将一个人从 1 岁到 100 岁的运势走势,以类似股票 K 线图的形式呈现,试图用数据可视化的方式“翻译”命理推演结果。
    查看完整榜单