SD百科导航
  • 首页
  • 快讯
  • 早报
  • 模型
  • ComfyUI
  • 工具
  • 新技术
  • 百科
    • 教程
    • 硬件
    • 科普
  • 知识库
  • 导航
  • 百科工具
    • 首页
    • 快讯
    • 早报
    • 模型
    • ComfyUI
    • 工具
    • 新技术
    • 百科
      • 教程
      • 硬件
      • 科普
    • 知识库
    • 导航
    • 百科工具

    新技术

    共 939 篇文章
    百科工具模型ComfyUIAI合集web UI提示词
    教程新技术硬件科普早报
    排序
    发布更新浏览点赞
    北卡教堂山分校新研究:GPT-5、Gemini-2.5-Pro等顶级多模态大语言模型,竟难区分图像90°与270°旋转

    北卡教堂山分校新研究:GPT-5、Gemini-2.5-Pro等顶级多模态大语言模型,竟难区分图像90°与270°旋转

    北卡罗来纳大学教堂山分校的研究团队,针对多模态大语言模型(MLLMs)的空间视觉推理能力展开专项测试——聚焦“图像旋转角度识别”任务(判断图像是否旋转0°、90°、180°、270°)。 GitHub...
    新技术# RotBench# 多模态大语言模型# 空间视觉推理能力
    4个月前
    01380
    自动化桌面任务设计的框架COMPUTERRL:通过强化学习提升计算机桌面智能代理的操作能力

    自动化桌面任务设计的框架COMPUTERRL:通过强化学习提升计算机桌面智能代理的操作能力

    清华大学、智谱AI和中国科学院大学的研究人员推出一个名为 COMPUTERRL 的框架,通过强化学习(Reinforcement Learning, RL)提升计算机桌面智能代理(agents)的操作...
    新技术# COMPUTERRL
    4个月前
    01410
    TLB-VFI:让视频帧插值更高效,时序信息与速度兼得

    TLB-VFI:让视频帧插值更高效,时序信息与速度兼得

    视频帧插值(VFI)是计算机视觉领域的关键任务——它能根据两个连续帧(过去帧(I_0)、未来帧(I_1))生成中间帧(I_n),让视频播放更流畅、压缩更高效。但现有方法始终面临“两难”:基于图像的扩散...
    新技术# TLB-VFI# 视频帧插
    4个月前
    01840
    如何让图像生成模型“遗忘”一个概念?东北大学与MIT提出扩散模型概念擦除新方法

    如何让图像生成模型“遗忘”一个概念?东北大学与MIT提出扩散模型概念擦除新方法

    随着图像生成模型(如Stable Diffusion、Flux等)在质量和可控性上的飞速进步,其潜在风险也日益凸显: 生成裸露或暴力内容 模仿特定艺术家风格引发版权争议 复现受保护的商标或人物形象 现...
    新技术# 图像生成模型# 概念擦除
    4个月前
    01700
    大模型 RL 加速新方案:FlashRL 实现无损量化 rollout

    大模型 RL 加速新方案:FlashRL 实现无损量化 rollout

    在大模型强化学习(RL)训练中,rollout 生成是耗时最长的环节之一。以 DAPO-32B 为例,rollout 阶段占据了约 70% 的总训练时间。这一瓶颈使得整个训练流程效率低下,尤其在大规模...
    新技术# FlashRL
    4个月前
    02730
     Echo-4o :通过利用 GPT-4o 生成的合成图像数据来提升多模态生成模型的性能

     Echo-4o :通过利用 GPT-4o 生成的合成图像数据来提升多模态生成模型的性能

    上海人工智能实验室、中山大学、香港中文大学和北京大学的研究人员推出 Echo-4o 系统,通过利用 GPT-4o 生成的合成图像数据来提升多模态生成模型(如文本到图像生成、多参考图像生成等任务)的性能...
    新技术# Echo-4o# GPT-4o# 多模态生成模型
    4个月前
    01590
    模型变强了,内部表示就更好了吗?MIT等提出“碎片化纠缠表示(FER)”假说

    模型变强了,内部表示就更好了吗?MIT等提出“碎片化纠缠表示(FER)”假说

    当我们看到大模型在各种任务上不断刷新性能纪录时,一个隐含的信念常常浮现:性能提升 = 内部表示更优。这种观点被称为“表示乐观主义”(Representational Optimism)——即认为随着模...
    新技术# FER# 碎片化纠缠表示
    4个月前
    02020
    DynamicFace:一种面向图像与视频的高保真人脸交换方法

    DynamicFace:一种面向图像与视频的高保真人脸交换方法

    人脸交换(Face Swapping)技术旨在将一个人的身份特征迁移到另一个人的面部图像或视频中,同时保留目标人物的表情、姿态、发型和背景等属性。近年来,随着生成模型的发展,人脸交换已能生成高度逼真的...
    新技术# DynamicFace# 人脸交换
    4个月前
    03200
    OPPO 发布 OAgents:一个模块化、可复现的基础智能体框架

    OPPO 发布 OAgents:一个模块化、可复现的基础智能体框架

    随着“智能体(Agentic AI)”成为 AI 发展的重要方向,各类框架层出不穷。然而,当前研究普遍存在评估标准不一、实现细节不透明、结果难以复现等问题,导致不同系统之间缺乏公平比较的基础。 为应对...
    新技术# OAgents# OPPO# 智能体框架
    4个月前
    01520
    字节跳动Seed团队发布WideSearch:首个面向大规模信息收集的智能体评估基准

    字节跳动Seed团队发布WideSearch:首个面向大规模信息收集的智能体评估基准

    在信息过载的时代,获取“更多”并不等于“更有效”。真正制约效率的,往往不是找不到某个具体答案,而是面对海量目标时的系统性整理能力——比如,为一个行业筛选出上百家公司数据,或从成千上万条招聘信息中精准匹...
    新技术# WideSearch# 字节跳动# 智能体评估基准
    4个月前
    04690
    Agentic Web:通过AI智能体(AI Agents)来构建下一代互联网

    Agentic Web:通过AI智能体(AI Agents)来构建下一代互联网

    上海交通大学、香港科技大学(广州)、利物浦大学、加州大学伯克利分校、上海创新学院、加州大学戴维斯分校、弗吉尼亚理工大学和伦敦大学学院的研究人员发布Agentic Web(智能体网络),它探讨了如何通过...
    新技术# Agentic Web
    4个月前
    01360
    NXN Labs推出新型虚拟试穿框架Voost:通过一个统一的扩散变换器同时实现虚拟试穿(试穿目标服装)和虚拟试脱(从人像中重建原始服装)功能

    NXN Labs推出新型虚拟试穿框架Voost:通过一个统一的扩散变换器同时实现虚拟试穿(试穿目标服装)和虚拟试脱(从人像中重建原始服装)功能

    NXN Labs推出新型虚拟试穿框架Voost,通过一个统一的扩散变换器(Diffusion Transformer)同时实现虚拟试穿(试穿目标服装)和虚拟试脱(从人像中重建原始服装)功能。 项目主页...
    新技术# Voost# 虚拟试穿
    4个月前
    02390
    加载更多
    SD百科导航
    SD百科导航是专注于AI创作领域的专业导航网站。我们全面涵盖Stable Diffusion、Flux、AI绘画、AI视频、AI音乐以及大语言模型等前沿内容。

    友链申请免责声明广告合作关于我们

    扫码关注微信公众号SD百科导航
    扫码关注微信公众号
    Copyright © 2025 SD百科导航 皖ICP备18025588号-5  皖公网安备34040002000401 
    网址
    网址文章软件模型

    网址

    日榜周榜月榜
    Fogsight (雾象)

    Fogsight (雾象)

    雾象是一款由大语言模型(LLM)驱动的动画引擎 agent 。用户输入抽象概念或词语,雾象会将其转化为高水平的生动动画。
    朱雀大模型检测

    朱雀大模型检测

    腾讯朱雀 AI 检测是于 2025 年 1 月 17 日推出的一款 AI 生成内容检测工具,主要用于帮助用户识别 AI 生成的文本和图像内容。每位用户每天最多可检测20次文本和20次图片。
    Next AI Draw.io

    Next AI Draw.io

    Next AI Draw.io 是一个基于 Next.js 的 Web 应用,将大语言模型(LLM)与 draw.io 的强大图表能力深度集成。用户可通过自然语言指令创建、修改和增强专业图表,无需手动拖拽。
    Tripo

    Tripo

    Tripo AI 是一家领先的 AI 驱动 3D 建模解决方案提供商,允许用户使用文本、单张图像、多张图像、涂鸦或视频等输入,快速创建高质量的 3D 模型和环境。
    Higgsfield AI

    Higgsfield AI

    Higgsfield AI平台支持文生图和图生视频,近期对图生视频功能进行了全面升级,专为追求高质量、风格化内容创作并渴望真正电影级操控的创意人士打造——无论是MV导演、商业片制作人、AI创作者,还是社交媒体叙事者。
    Google AI Studio

    Google AI Studio

    Google AI Studio 是一个功能齐全的工具,特别适合希望快速构建和试验 AI 应用的开发者。其多模态支持、提示库和与 Gemini API 的无缝集成使其成为生成 AI 开发的有力平台。
    查看完整榜单