SD百科导航
  • 首页
  • 快讯
  • 早报
  • 模型
  • ComfyUI
  • 新技术
  • 百科
    • 教程
    • 硬件
    • 科普
  • 百科工具
    • 工具
  • 知识库
  • 排行榜
    • 首页
    • 快讯
    • 早报
    • 模型
    • ComfyUI
    • 新技术
    • 百科
      • 教程
      • 硬件
      • 科普
    • 百科工具
      • 工具
    • 知识库
    • 排行榜

    模型

    共 1020 篇文章
    百科工具模型ComfyUIAI合集web UI提示词
    大语言模型多模态模型图像模型语音模型3D模型Flux衍生视频模型
    排序
    发布更新浏览点赞
    字节跳动提出的新一代多主体可控图像生成模型XVerse

    字节跳动提出的新一代多主体可控图像生成模型XVerse

    在文本到图像生成领域,如何实现对多个主体身份和语义属性(如姿势、风格、照明)的细粒度控制,同时保持高质量和一致性,一直是一个极具挑战性的问题。 传统方法往往存在以下问题: 在多主体场景中容易引入视觉伪...
    图像模型# XVerse# 图像生成模型
    6个月前
    02950
    阿里 Qwen 项目组正式推出全新多模态模型Qwen VLo

    阿里 Qwen 项目组正式推出全新多模态模型Qwen VLo

    随着多模态大模型的不断发展,我们对技术边界的认知也在持续被刷新。从最初的 QwenVL 到如今的 Qwen2.5 VL,我们在提升模型图像理解能力方面不断取得进步。 项目主页:https://qwen...
    多模态模型# Qwen VLo# Qwen 项目组# 阿里巴巴
    6个月前
    01990
    阿里通义项目组更新 Qwen-TTS:合成语音自然度接近人类水平

    阿里通义项目组更新 Qwen-TTS:合成语音自然度接近人类水平

    阿里通义实验室通过 Qwen API 发布了最新版本的 Qwen-TTS 语音合成模型(支持 qwen-tts-latest 或 qwen-tts-2025-05-22)。该模型在语音合成领域实现了多...
    语音模型# Qwen-TTS
    6个月前
    03680
    Jina AI推出文本嵌入模型Jina Embeddings v4:多模态多语言检索的通用嵌入模型

    Jina AI推出文本嵌入模型Jina Embeddings v4:多模态多语言检索的通用嵌入模型

    Jina AI正式发布 jina-embeddings-v4 —— 一款全新的38亿参数通用嵌入模型,支持文本与图像输入,适用于多种检索任务。该模型在多个基准测试中表现优异,特别是在处理表格、图表等视...
    多模态模型# Jina AI# Jina Embeddings v4# 文本嵌入模型
    6个月前
    02470
    JarvisArt:由AI驱动的照片修饰智能体,释放你的艺术创造力

    JarvisArt:由AI驱动的照片修饰智能体,释放你的艺术创造力

    来自厦门大学、香港科技大学(广州)、字节跳动、新加坡国立大学等机构的研究人员联合推出了一项令人瞩目的新成果 —— JarvisArt。这是一个由多模态大语言模型(MLLM)驱动的照片修饰智能体,能够理...
    图像模型# JarvisArt# 照片修饰智能体
    6个月前
    03470
    谷歌发布 Gemma 3n:为移动设备而生的高效多模态AI模型

    谷歌发布 Gemma 3n:为移动设备而生的高效多模态AI模型

    继去年首款 Gemma 模型发布以来,Gemmaverse 生态系统迅速壮大,累计下载量突破 1.6亿次,覆盖从安全防护到医疗应用等十余个专业领域。社区创新成果斐然,例如 Roboflow 打造的企业...
    大语言模型# Gemma 3n# 谷歌
    6个月前
    01750
    腾讯推出全新MoE模型Hunyuan-A13B:小参数、高性能的AI新选择

    腾讯推出全新MoE模型Hunyuan-A13B:小参数、高性能的AI新选择

    在大模型持续演进的过程中,如何在提升性能的同时控制资源消耗,成为行业面临的关键挑战。腾讯最新推出的 Hunyuan-A13B 模型,正是这一问题的创新性解决方案。该模型采用混合专家(MoE)架构,在仅...
    大语言模型# Hunyuan-A13B# 腾讯
    6个月前
    01510
    黑森林实验室正式发布图像编辑模型FLUX.1 Kontext [dev]

    黑森林实验室正式发布图像编辑模型FLUX.1 Kontext [dev]

    截至今日,所有高性能的生成式图像编辑模型均为专有工具。今天,这一局面发生了改变。 黑森林实验室(Black Forest Labs)发布了 FLUX.1 Kontext [dev],这是 FLUX.1...
    图像模型# FLUX.1 Kontext [dev]# 图像编辑模型# 黑森林实验室
    6个月前
    05590
    Janus-4o:基于数据集 ShareGPT-4o-Image 的新型多模态图像生成模型

    Janus-4o:基于数据集 ShareGPT-4o-Image 的新型多模态图像生成模型

    香港中文大学(深圳) 的研究人员推出了一项重要的多模态研究成果 —— ShareGPT-4o-Image 数据集 及其衍生的开源多模态大语言模型 Janus-4o。该研究旨在将 GPT-4o 在图像生...
    图像模型# Janus-4o# ShareGPT-4o-Image# 数据集
    6个月前
    03150
    阿里通义实验室推出的端到端网络代理训练框架WebDancer

    阿里通义实验室推出的端到端网络代理训练框架WebDancer

    在信息检索和智能代理领域,如何让 AI 代理具备自主搜索、推理和决策能力是一个关键挑战。为此,阿里通义实验室提出了 WebDancer —— 一个全新的 端到端代理训练框架,旨在增强基于网络的代理在多...
    大语言模型# WebDancer# 阿里通义实验室
    6个月前
    02580
    对话也能生成语音?复旦大学开源 MOSS-TTSD 实现高质量对话语音合成

    对话也能生成语音?复旦大学开源 MOSS-TTSD 实现高质量对话语音合成

    复旦大学 OpenMOSS 团队正式发布了全新语音生成模型 MOSS-TTSD(Text to Spoken Dialogue),这是目前首个能够直接从对话文本生成自然、富有表现力对话语音的大规模模型...
    语音模型# MOSS-TTSD# 复旦大学
    6个月前
    04560
    Neta Lumina 发布:专为二次元创作打造的高品质图像生成模型

    Neta Lumina 发布:专为二次元创作打造的高品质图像生成模型

    由捏Ta实验室(Neta.art)训练的 Neta Lumina 是一款专注于二次元风格的高质量图像生成模型。此模型基于上海人工智能实验室 Alpha-VLLM 团队开源的 Lumina-Image...
    图像模型# Neta Lumina# 二次元
    6个月前
    08020
    加载更多
    SD百科导航
    SD百科导航是专注于AI创作领域的专业导航网站。我们全面涵盖Stable Diffusion、Flux、AI绘画、AI视频、AI音乐以及大语言模型等前沿内容。

    关于我们网址提交友链申请广告合作

    扫码关注微信公众号SD百科导航
    扫码关注微信公众号
    Copyright © 2025 SD百科导航 皖ICP备18025588号-5  皖公网安备34040002000401 
    网址
    网址文章软件模型

    网址

    日榜周榜月榜
    人生 K 线

    人生 K 线

    人生 K 线(Life Destiny K-Line)是一个结合传统八字命理与现代大语言模型(LLM)的轻量级可视化工具。它将一个人从 1 岁到 100 岁的运势走势,以类似股票 K 线图的形式呈现,试图用数据可视化的方式“翻译”命理推演结果。
    Fogsight (雾象)

    Fogsight (雾象)

    雾象是一款由大语言模型(LLM)驱动的动画引擎 agent 。用户输入抽象概念或词语,雾象会将其转化为高水平的生动动画。
    朱雀大模型检测

    朱雀大模型检测

    腾讯朱雀 AI 检测是于 2025 年 1 月 17 日推出的一款 AI 生成内容检测工具,主要用于帮助用户识别 AI 生成的文本和图像内容。每位用户每天最多可检测20次文本和20次图片。
    PDF Craft

    新PDF Craft

    PDF Craft是一款专注于扫描版书籍 PDF 转换的开源工具。它利用 DeepSeek OCR 模型,在本地完成从图像型 PDF 到结构化电子书(如 Markdown 或 EPUB)的全流程处理,无需联网,不依赖大语言模型(LLM),适合对隐私、精度与效率有要求的用户。
    ITELLOU

    ITELLOU

    ITELLYOU(也称为NEXT, ITELLYOU)是一个专注于提供微软原版软件资源的非官方网站,主要帮助用户获取未经修改的微软产品镜像,如Windows操作系统、Office办公软件和开发工具等。
    Google AI Studio

    Google AI Studio

    Google AI Studio 是一个功能齐全的工具,特别适合希望快速构建和试验 AI 应用的开发者。其多模态支持、提示库和与 Gemini API 的无缝集成使其成为生成 AI 开发的有力平台。
    查看完整榜单