SD百科导航
  • 首页
  • 快讯
  • 早报
  • 模型
  • ComfyUI
  • 新技术
  • 百科
    • 教程
    • 硬件
    • 科普
  • 百科工具
    • 工具
  • 排行榜
  • 网址提交
    • 首页
    • 快讯
    • 早报
    • 模型
    • ComfyUI
    • 新技术
    • 百科
      • 教程
      • 硬件
      • 科普
    • 百科工具
      • 工具
    • 排行榜
    • 网址提交

    模型

    共 1053 篇文章
    百科工具模型ComfyUIAI合集web UI提示词
    大语言模型多模态模型图像模型语音模型3D模型Flux衍生视频模型
    排序
    发布更新浏览点赞
    开源框架OpenDeepSearch,挑战Perplexity和ChatGPT搜索

    开源框架OpenDeepSearch,挑战Perplexity和ChatGPT搜索

    Sentient Foundation的研究团队近日发布了开源深度搜索(Open Deep Search,简称ODS),这是一款开源框架,能够匹敌如Perplexity和ChatGPT Search等...
    大语言模型# ODS# Open Deep Search# 开源深度搜索
    9个月前
    03800
    Meta发布Llama 4系列多模态模型:首次采用MoE架构,最高1000万上下文长度

    Meta发布Llama 4系列多模态模型:首次采用MoE架构,最高1000万上下文长度

    2025年4月6日星期日,Meta正式推出了其最新的AI模型系列——Llama 4。这款新模型不仅支持网络版Meta AI助手,还为WhatsApp、Messenger和Instagram等平台提供了...
    大语言模型# Llama 4# Meta# MoE架构
    9个月前
    04580
    高保真三维形状合成方法TripoSG:利用大规模的修正流模型从单张图像生成高质量的三维网格模型

    高保真三维形状合成方法TripoSG:利用大规模的修正流模型从单张图像生成高质量的三维网格模型

    VAST、香港大学、德克萨斯大学奥斯汀分校和上海人工智能实验室的研究人员推出高保真三维形状合成方法TripoSG,它利用大规模的修正流模型(Rectified Flow Models)从单张图像生成高...
    3D模型# 3D模型# TripoSG
    9个月前
    02700
    HSMR:用于从单张图像中重建具有生物力学准确骨架的三维人体模型

    HSMR:用于从单张图像中重建具有生物力学准确骨架的三维人体模型

    德克萨斯大学奥斯汀分校和浙江大学的研究人员推出HSMR,用于从单张图像中重建具有生物力学准确骨架的三维人体模型。该方法通过训练一个基于 Transformer 的网络,估计生物力学模型 SKEL 的参...
    图像模型# HSMR# 三维人体模型# 骨架
    10个月前
    04010
    新型框架 EliGen:用于实现图像生成中的实体级控制

    新型框架 EliGen:用于实现图像生成中的实体级控制

    浙江大学控制科学与工程学院、阿里巴巴集团ModelScope团队和华东师范大学的研究人员推出新型框架 EliGen,用于实现图像生成中的实体级控制。EliGen 通过引入区域注意力(Regional ...
    图像模型# EliGen# 图像生成
    10个月前
    02060
    昆仑万维开源图生视频模型SkyReels-A2,基于阿里Wan2.1微调而成

    昆仑万维开源图生视频模型SkyReels-A2,基于阿里Wan2.1微调而成

    昆仑万维在上个月推出面向 AI 短剧创作的视频生成模型 SkyReels-V1后,又在近期开源SkyReels-A2,可以将任意视觉元素(如人物、物体、背景等)根据文本提示组装成合成视频,同时严格保持...
    视频模型# SkyReels-A2# Wan2.1# 昆仑万维
    10个月前
    03700
    新型多模态生成模型UniDisc:基于离散扩散过程的统一生成模型,能够同时理解和生成文本和图像

    新型多模态生成模型UniDisc:基于离散扩散过程的统一生成模型,能够同时理解和生成文本和图像

    卡内基梅隆大学的研究人员推出新型多模态生成模型 UniDisc(Unified Multimodal Discrete Diffusion),UniDisc 是一个基于离散扩散过程的统一生成模型,能够...
    图像模型# UniDisc# 多模态生成模型
    10个月前
    03930
    IntrinsiX:能够直接从文本描述生成高质量的物理基础渲染(PBR)图像

    IntrinsiX:能够直接从文本描述生成高质量的物理基础渲染(PBR)图像

    传统的文生图模型(如 Stable Diffusion)能够根据文本描述生成高质量的 RGB 图像,但这些图像通常包含固定的光照效果(如反射、阴影、高光),这限制了它们在需要 PBR 地图(如游戏、V...
    图像模型# IntrinsiX# PBR
    10个月前
    02490
    自回归模型Lumina-mGPT 2.0:支持文生图、多轮图像编辑、可控生成等

    自回归模型Lumina-mGPT 2.0:支持文生图、多轮图像编辑、可控生成等

    上海人工智能实验室和香港中文大学的研究人员之前推出了新型多模态自回归模型Lumina-mGPT,研究团队在今天推出了一种独立的、仅解码器的自回归模型Lumina-mGPT 2.0,从头开始训练,统一了...
    图像模型# Lumina-mGPT 2.0# 自回归模型
    10个月前
    03860
    Tessa-T1:专为 React 前端开发打造的推理模型

    Tessa-T1:专为 React 前端开发打造的推理模型

    在前端开发领域,React 一直是构建现代 Web 应用的核心框架之一。然而,随着项目复杂度的增加,手动编写和优化 React 组件变得越来越耗时且容易出错。为了提升开发效率并简化前端工作流程,Tes...
    大语言模型# Qwen2.5-Coder# Tessa-T1# 推理模型
    10个月前
    02410
    腾讯推出AnimeGamer:通过多模态大语言模型实现无限动漫生活模拟

    腾讯推出AnimeGamer:通过多模态大语言模型实现无限动漫生活模拟

    近年来,图像和视频合成技术的发展为生成游戏带来了新的可能性。特别是将动漫电影中的角色转化为可互动、可玩的实体,让玩家能够以自己喜爱的角色身份沉浸在动态的动漫世界中,通过语言指令进行生活模拟。这种游戏被...
    多模态模型# AnimeGamer# 多模态大语言模型# 无限动漫生活模拟
    10个月前
    03900
    增强版多模态大语言模型ILLUME+ :通过双视觉标记化和扩散解码器来提升深度语义理解和高保真图像生成的能力

    增强版多模态大语言模型ILLUME+ :通过双视觉标记化和扩散解码器来提升深度语义理解和高保真图像生成的能力

    近年来,多模态大语言模型(MLLMs)在图像理解、生成和编辑任务中取得了显著进展。然而,现有的统一模型在同时处理这三种任务时面临挑战。例如,早期的模型(如 Chameleon 和 EMU3)使用 VQ...
    多模态模型# ILLUME# 图像生成# 多模态大语言模型
    10个月前
    04630
    加载更多
    SD百科导航
    SD百科导航是专注于AI创作领域的专业导航网站。我们全面涵盖Stable Diffusion、Flux、AI绘画、AI视频、AI音乐以及大语言模型等前沿内容。

    关于我们网址提交友链申请广告合作

    扫码关注微信公众号SD百科导航
    扫码关注微信公众号
    Copyright © 2026 SD百科导航 皖ICP备18025588号-5  皖公网安备34040002000401 
    网址
    网址文章软件模型

    网址

    日榜周榜月榜
    人生 K 线

    人生 K 线

    人生 K 线(Life Destiny K-Line)是一个结合传统八字命理与现代大语言模型(LLM)的轻量级可视化工具。它将一个人从 1 岁到 100 岁的运势走势,以类似股票 K 线图的形式呈现,试图用数据可视化的方式“翻译”命理推演结果。
    Fogsight (雾象)

    Fogsight (雾象)

    雾象是一款由大语言模型(LLM)驱动的动画引擎 agent 。用户输入抽象概念或词语,雾象会将其转化为高水平的生动动画。
    Apple Wallpapers

    Apple Wallpapers

    AppleWalls 提供 iPhone、iPad 与 Mac 系统原生高清壁纸下载,收录 iOS 与 macOS 各版本官方壁纸。探索苹果设计美学,体验纯粹的 Apple 风格。
    互联网大厂模拟器

    互联网大厂模拟器

    《互联网大厂模拟器》或许不会改变现实,但它提供了一个出口:在虚拟世界里,我们可以安全地体验“另一种职场人生”,然后笑着关掉页面,继续面对明天的站会。
    Tripo

    Tripo

    Tripo AI 是一家领先的 AI 驱动 3D 建模解决方案提供商,允许用户使用文本、单张图像、多张图像、涂鸦或视频等输入,快速创建高质量的 3D 模型和环境。
    Higgsfield AI

    Higgsfield AI

    Higgsfield AI平台支持文生图和图生视频,近期对图生视频功能进行了全面升级,专为追求高质量、风格化内容创作并渴望真正电影级操控的创意人士打造——无论是MV导演、商业片制作人、AI创作者,还是社交媒体叙事者。
    查看完整榜单