腾讯推出 Think in Games (TiG) 框架:通过强化学习结合大语言模型来提升模型在游戏环境中的决策和推理能力腾讯推出 Think in Games (TiG) 框架,通过强化学习(Reinforcement Learning, RL)结合大语言模型(LLMs)来提升模型在游戏环境中的决策和推理能力。TiG ...新技术# Think in Games# 腾讯3个月前01680
新型辅助训练目标Token Order Prediction (TOP):用于改进语言模型中的下一个词预测(NTP)任务MBZUAI推出新型辅助训练目标Token Order Prediction (TOP),用于改进语言模型中的下一个词预测(Next-Token Prediction, NTP)任务。TOP 通过预测...新技术# TOP# 辅助训练目标3个月前0730
字节跳动推出 UltraMemV2:在低内存访问下,追平8专家MoE性能在大模型稀疏化架构的演进中,效率与性能的权衡始终是核心挑战。 MoE(Mixture of Experts)通过仅激活部分专家实现高效推理,但其频繁的跨专家参数访问带来了高昂的内存开销。为解决这一问题...新技术# UltraMemV2# 字节跳动3个月前0800
Beyond Memorization:通过不同的架构和训练方法来提升大语言模型多步推理能力阿联酋MBZUAI、莫斯科物理技术学院、莫斯科AIRI和伦敦数学科学研究所的研究人员推出Beyond Memorization,通过不同的架构和训练方法来提升大语言模型(LLMs)多步推理能力。作者们...新技术# Beyond Memorization# 大语言模型3个月前0840
应对 95% AI 试点失败!Salesforce 发布 CRMArena-Pro,模拟真实业务环境企业AI的一大痛点是“演示时亮眼,落地时拉胯”——MIT最新报告显示,95%的企业生成式AI试点无法推进至生产阶段,Salesforce自身研究也发现,仅依赖大语言模型(LLM)的AI代理在复杂业务场...新技术# CRMArena-Pro# Salesforce3个月前01360
Sakana AI 新算法 M2N2:无需重新训练,让 AI 模型 “进化” 得更强日本 AI 实验室 Sakana AI 近期推出一项突破性技术 ——自然生态位模型合并(M2N2) ,彻底改变了 AI 模型的优化逻辑。与传统依赖昂贵算力和海量数据的 “重新训练”“微调” 不同,M2...新技术# M2N2# Sakana AI3个月前01020
Mixture of Contexts (MoC) :新型注意力机制模块来解决长视频生成中的长期记忆问题斯坦福大学、字节跳动、约翰·霍普金斯大学和香港中文大学的研究人员推出一种名为 Mixture of Contexts (MoC) 的新型注意力机制模块来解决长视频生成中的长期记忆问题。长视频生成的关键...新技术# MoC# 长视频生成3个月前0950
TKG-DM:无需微调,让扩散模型精准生成色键背景图像当前扩散模型已能生成高真实感、高文本忠实度的图像,但主流大规模文本到图像模型(如 Stable Diffusion)面临一大局限——难以生成“前景对象置于色键背景”的图像,若要分离前景与背景元素,往往...新技术# TKG-DM3个月前01160
TransMLA 框架 + TPLA 机制:解决 GQA 模型迁移痛点,大幅提升 LLM 推理效率由北京大学人工智能研究院、北京通用人工智能研究院与腾讯优图实验室联合提出的新方法 TransMLA,为大模型推理效率的提升提供了一条实用路径。该方法能够将已广泛部署的 GQA(Grouped Quer...新技术# TPLA 机制# TransMLA3个月前01280
XQUANT:通过低比特量化和KV缓存重物质化来显著降低大语言模型推理过程中的内存消耗加州大学伯克利分校、FuriosaAI、ICSI和劳伦斯伯克利国家实验室的研究人员推出一种名为XQUANT的技术,通过低比特量化和KV缓存重物质化来显著降低大语言模型(LLM)推理过程中的内存消耗。X...新技术# KV缓存# XQUANT4个月前01520
港大、浙大联合快手提出Context-as-Memory:解决交互式长视频生成的场景一致性难题香港大学、浙江大学与快手可灵团队的研究人员,针对当前交互式长视频生成中“场景易断裂、历史上下文难复用”的痛点,提出 Context-as-Memory(上下文即记忆) 方法。该方法通过将历史帧直接作为...新技术# Context-as-Memory# 场景一致性4个月前01700
DuPO框架:通过双学习和偏好优化的方法,使大语言模型能够在没有标注数据的情况下进行自我验证和优化字节跳动Seed团队和南京大学的研究人员推出DuPO框架,它通过双学习(dual learning)和偏好优化(preference optimization)的方法,使大语言模型(LLMs)能够在没...新技术# DuPO框架# 大语言模型4个月前01550