01DeepSeek-AIDeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression区分全局KV、持久缓存和完整服务成本,解析CED、跨层共享、量化与近似回放。
02浙江大学;合作阿里巴巴RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning先训练可靠技能教师,再用对齐停滞和相对能力共同判断何时退出蒸馏。
03南方科技大学;合作北京大学、鹏城实验室On-Demand Attention: Language Models Know When to Recall保留完整历史KV,通过小型召回头控制全局读取;质量与计时使用不同运行点。
04美团UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising目标前缀、稀疏适配和专属残差构成多策略生成;保留延迟成本和原文数值矛盾。
05阿里巴巴(一作邮箱taobao.com,论文未列完整机构映射,按邮箱谨慎识别)Reasoning Quality Matters: Combating Reasoning Collapse in LLM-based Embedding Learning参考引导恢复生成与表示,双奖励改善检索相关文本,同时检验代码领域退化。
06Z LabDense Feature Representation over Sequence Modeling: A Solution to the KDD Cup 2026 UniRec Challenge逐步升级和留一消融揭示特征与优化器贡献,关注验证榜单分布差异与选择偏差。
07加州大学伯克利分校A Zeroth-Order Paradigm for LLM Preference Alignment低似然差偏好对通过比较oracle提取方向;输出层扰动与阈值化,online仅用无标签生成调步长。
08上海交通大学,合作:上海人工智能实验室等Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening终局奖励重复到每个token造成critic方差惩罚与梯度冗余;仅稀疏锚点监督critic,actor与逐token值预测保留。
09腾讯优图实验室,合作:东方理工、香港理工、深圳河套学院Disentangling Long-Term Memory via Latent Neuro-Symbolic Reasoning历史隐状态压成latent节点,SAE稀疏概念,query条件构图/GNN,16prefix token生成;生成+证据重建+SAE联合训练backbone。
10快手Scaling Articulated Rationales for MLLM-based Recommendation问卷反馈过滤为作者级正负理由;SFT+QR-DPO扩展全作者;正向MIM对齐UA,负向理由SID共享并target attention。
11MetaLIGE-GR: A Smooth Leap from Ranking to Generative Recommendation in the LLM Era保留CF加4层4头CA;ListVM累计继续概率,Palette束搜索+剩余价值duration修正;复用embedding/KV。
12腾讯One-Step Retrieval Framework for Real-Time Sponsored Search Ads Using Hierarchical Text Representations生成商业意图×广告抽取摘要,倒排索引;生成CE+CLS相关BCE+DPO商业价值训练;动态有效广告约束trie,保留末级排序。
13Amazon AGIWhere Should a Document Live: Context, Representations, or Parameters?受控比较上下文、KV与参数知识注入,包含多文档组合和遗忘边界。
14首尔国立大学;合作机构KAISTLoopSpec: Pipelined Self-Speculative Decoding for Looped Transformers复用循环深度作流水线投机解码,区分串行步数与实测时延。
16香港浸会大学Efficient Swing Computation for Retrieval in Large-Scale Recommender Systems以误差保证和过滤精化降低Swing召回计算成本。
17The Walt Disney Company(工作完成时;一作现Intuit)AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale生产日志诊断到代码建议与离线否证,避免把Agent判断当因果。
18Wolt(DoorDash)Balancing Trial and Reorder: A Hybrid Sequential Transformer-GBDT Ranker for On-Demand DeliveryTransformer与GBDT混合排序,以三轮线上试验分析尝鲜复购取舍。
19清华大学The Router Within: Eliciting Native Skill Routing from a Frozen LLM冻结主干中层状态经两个投影做Glance,候选技能复用KV后以任务似然和yes/no构成Verdict,三路分数融合。
21英属哥伦比亚大学;合作Vector InstituteMoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup每个token映射多槽,隐藏态路由选择,按head注入value,分组共享表并门控。
22新加坡国立大学;合作Meta AISelf-Evolving Memory for Generative Recommendation通过稀疏键值记忆、全历史查询与辅助巩固监督,共同微调主干和记忆,缓解持续推荐中的模式冲突。
23阿里国际数字商业集团LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training生成式预训练迁移稀疏与稠密参数,残差adapter注入排序独有特征,请求感知长序列稀疏注意力,跨epoch重置稀疏并持续训练稠密参数。
24中国科学技术大学;合作阿里淘天、南开大学VARG: Value-Aware and Ranking-Aligned Generative Retrieval for Dynamic E-commerce SearchRQ前两级语义加第三位价值排序ID;三阶段SFT、LO-SFT、Prefix-GRPO;旧ID冻结增量更新,新商品允许受控共享;召回直入既有精排。
25腾讯混元 / 香港科技大学(广州),合作含香港科技大学SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking门控分数以log形式进入注意力softmax;冻结Qwen骨干训练selector,续训OLMo实验则训练全模型。
26清华大学;合作微软研究院Expert-Space Exploration in MoE Reinforcement Learning保留高置信专家锚点,候选池内随机路由,熵调节扰动,rollout路由回放。
27北京理工大学;合作北京航空航天大学、哈尔滨工业大学、百度LifeMem: Enabling Lifelong Experience Reuse for LLM Agents按workflow聚类轨迹,簇内技能蒸馏,同时检索技能及具体轨迹。
28阿里巴巴国际数字商业集团MIMA: Multi-Interest Recommendation via Multi-Positive Exclusive Assignment请求级多正样本,因果decoder多兴趣,Hungarian排他匹配;路由概率校准,多损失梯度隔离。
29新南威尔士大学;共同一作与合作机构腾讯ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling时间多粒度合并,交错查询因果压缩,多时间跨度分支与Chronicle Alignment预训练。
30香港大学;共同一作快手,合作北京大学OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation共享prompt状态,紧凑GDN转移记录,投影重放,beam祖先索引和融合kernel。
31上海人工智能实验室;上海交通大学 LUMIA LabNCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction联合词元与离散概念预测
33Microsoft CorporationGrounding Agent Memory: Environment-Probing Curation for Enterprise Agents异步记忆curator增加最小权限只读环境探测,检查/限定/刷新候选记忆
34快手UniRec: Cross-stage Multi-Task Fusion with Preference Alignment for Cascaded Recommender Systems粗排精排fusion共享部分embedding并联合训练
35复旦大学FedHUR: Learning Hierarchical Utility-Guided Client Relations for Personalized Federated Recommendation以item-item滤波器构造层级聚合
36MetaAuto-RecSys: Harnessing Autonomous Research Agents for Industry-Scale Recommender System工业推荐多天训练
37字节跳动Make It Long, Keep It Fast: End-to-End 10k-Sequence Modeling at Billion Scale on Douyin Recommendation用单查询目标到历史交叉注意力、请求级批处理与稀疏训练稠密推理,把 10k 长历史真正端到端喂进精排。
38中国科学院自动化研究所ConvMem: Convolutional Memory for Long-Context Reasoning用分层并行摘要、重叠扫描与原文跳连处理超长上下文,同时区分关键路径与总推理成本。
39University of Central FloridaKVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints在同一评测协议下比较跨上下文和检查点的KV复用,分开核算质量恢复、计算、内存和延迟。
40中国科学院信息工程研究所;合作:中国科学院大学、京东CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood Shifts减去教师家族内弱参考的似然偏移,再以冻结学生参考锚定跨家族在策略蒸馏。
41Griffith University; Edith Cowan University; University of Queensland; HUTECH UniversityAn Efficient and Effective Agentic Group Shilling Attack on Recommender Systems在离线重训协议中研究协调式虚假用户对推荐模型和检测器的影响,检验正常质量能否掩盖目标操纵。
42Cornell University (Cornell Tech); PayPalExploring Bottom-Up Clustering for Creating Semantic IDs从局部邻域自底向上构造唯一语义ID;聚类质量收益与推荐指标收益需要分别验证。
43Institut de Recherche en Informatique de Toulouse (IRIT)PDMR: Passage-Driven Multi-ID Document Retrieval将一篇文档映射到多个段落ID,以多目标训练覆盖不同查询意图,并以文档级聚合评价检索。
44vivo AI LabToolLoop: Closed-Loop Tool-Use Data Synthesis via Decomposed Generation and Dynamic Self-Feedback分阶段合成与反馈纠错,含函数隔离与跨基准检验。
45中山大学Do Dynamic Routers Need Memory? HeRo: History-Aware Routing for Efficient LLM Inference跨层路由历史作为轻量状态,检验路径依赖。
46NAVER Applied AI Group;一作另属首尔大学医院 HARIRouter Prior Bias: Preserving Base Routing Structure in MoE Post-Training比较均匀负载、无约束、软锚定与硬约束,区分机制与伴随现象。
47ByteDanceSequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching100K历史的模型与存储、通信、训练服务协同优化。
48Hello Group(挚文集团)Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones共享/私有锚点贯穿序列与特征交互主干。
49Alibaba International Digital Commerce GroupEAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search课程SFT扩意图覆盖,混合奖励与偏好排序作业务对齐。
50华为(第一作者同时署名北京航空航天大学)Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference不改变推理Top-K规则,通过联合后训练优化缓存保留和因果前取;需把主动传输计入成本。
51南京大学GUT: Quantifying and Optimizing the Reasoning Uncertainty of LLMs via Graph Complexity用推理图复杂度度量不确定性,并研究基于代理目标的优化;低不确定性不等于正确。
52Capital OneCAGE: Coherence-Aware Graph Encoding for Retrieval-Augmented Generation把片段间一致性加入RAG重排,关注桥接证据完整性以及近同构错误事实的失败。
53AllegroBeyond Co-purchase Relation: Evolution of Complementary Recommendations at Allegro用ComCat与类别适配器将共购关系约束为互补商品检索,存在生产A/B证据。
54American University(美国大学)MURAL: Multimodal Uncertainty-aware Recommendation via Adaptive edge Learning联合可学习边、不确定性融合和停止梯度的行为对齐,评估全量排序与噪声鲁棒性。
55华中科技大学、阿里巴巴(第一作者双署名)LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining多兴趣划分后生成引导查询,用SFT、RL、DPO和近线生成满足线上约束。
56一作主机构未核验;PDF未列机构,通讯作者邮箱域名为houmo.ai,不据此推断全体作者归属ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMsGSP与RCR两种专家贡献代理,运行时取max保守联合跳过并保护top-1;离线权重统计不改变checkpoint。
57清华大学;合作机构美团,一作实习工作What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection学生on-policy轨迹上的top-16子词表反向KL;研究1-shot、难度、CoT长度和熵,再选8个难例。
58汉阳大学;合作机构成均馆大学BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference维护全局查询簇代表beacon queries,与近期query共同评估KV重要度,以覆盖thought revisiting远程回看。
59Amazon Everyday Essentials TechnologiesDistill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up RecommendationLLM生成四类商品关系和理由,15.5M嵌入对学生经理由对齐与对比训练;冻结全局学生并用每商品类型少样本适配器。
60IIT-CNR;合作机构Seltz、ISTI-CNREmbedding Surgery: Localized Updates for Adaptive Ranking Correction in Dense Retrieval固定查询与编码器,对少数文档向量解最小扰动凸二次规划以满足排序约束;单pair有闭式解,可写回ANN索引。
61小红书;合作机构南京大学,二作在小红书实习Latent-Aligned Reasoning for Multimodal Recommendation阶段一交错latent tokens与CoT并对齐冻结视觉编码器;阶段二桥接MLP+i2i对比,向阶段一CoT hidden states对齐以保留推理。
62Central South University / Shopee / NTU · ReSIDRethinking Generative Recommender Tokenizer用 FAMAE 学推荐充分字段表征,并用 GAOQ 做全局对齐正交量化,降低 Semantic ID 的语义歧义和自回归前缀不确定性。
63Shanghai Jiao Tong UniversityCUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents用真实桌面软件构建 GUI 与 CLI 混合环境,经任务合成和路径引导生成训练轨迹,联合衡量成功率与操作成本。
64未核验:PDF 首页仅列作者及邮箱,不能凭邮箱推断正式机构Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability把记忆写入、检索和读取拆开评测,检查模型升级后的迁移损失、混合向量索引及原始历史保留的恢复价值。
65Salesforce AI ResearchRISE: Recursive Improvement via Self-Extrapolating Policy Distillation沿模型自身 RLVR 更新方向外推教师,再用 token 级蒸馏迭代改善学生,比较参数空间与 logit 空间两种实现。
66Alibaba International Digital Commerce GroupSAM-D2Q: Aligning Multimodal Doc2Query with Search Demand and Conversion for E-commerce在布尔倒排召回约束下,通过词汇增益、多模态反事实增强和业务偏好对齐生成有效商品扩展查询。
67Xi’an Jiaotong-Liverpool UniversityAtomRec: Evolving Atomic Memory for Agentic Recommendation将用户和物品记忆拆成结构化原子,随新交互更新语义关联,并沿多跳证据路径完成推荐排序。
68Huawei Technologies Co., Ltd.Personalized Task Dependency Graphs for Mitigating Signal Erosion in Multi-Task Recommendation在转化顺序约束下为物品生成任务依赖强度,结合图传播和按稀疏度逐步开放参数改善深层转化预估。
69Meta AI · CORALCORAL: An LLM-Native Harness for Production Recommender SystemsLLM 不逐请求生成推荐,而是在低频控制面读取聚合信号、调用数值优化器并把真实 A/B 结果写回决策记忆;两项生产案例分别覆盖互动提升与服务成本节省。
70上海交通大学 / 快手 · DMRLDMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation上层优化器只产生结构化文档 patch,下层任务代理冻结;LRP 负责短期到长期回报预测,DRPO 用稳健组内比较、并发对照和编辑成本分配信用。
71高德 / 香港中文大学(深圳) · SPARSPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial PerceptionSPAR 同时改造 tokenization、空间认知和行为适配:SI-SID 写入坐标几何,MG-CPT 学道路与导航关系,TV-SFT 在大规模行为微调中抑制空间知识遗忘。
72KAIST AI / Google DeepMind(顾问) · Declarative AttentionLanguage Models Can Control Their Own Attention模型先用文本声明下一段推理需要读取哪些上下文,引擎再重写 KV block table;主结果是 attended tokens 减少,而非已经实测的端到端加速。
73上海交通大学 / 新加坡管理大学 · EarlyEvalEarlyEval: Cheaper Agent Evaluation via Early Outcome PredictionEarlyEval 不减少 benchmark 任务,而是预测单条轨迹何时已经足以判断结局;论文同时报告预测精度、覆盖率、steps/tokens 节省、分数扰动和排行榜保真度。
74NVIDIA · Nemotron-CCPost-Training Language Models for Gold-Medal Performance in Coding CompetitionsNVIDIA 分解数据、SFT、Nano 规模 RL 与受 submission budget 约束的 GenCorrect;IOI 2026 的 535.4/600 是非官方、未监督且未进入正式排名的前瞻运行。
75Tencent Platform and Content Group · TGRTGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning把 CCFormer、BARGE、HiGR 与离线推理注入组合成腾讯生成式推荐栈,并用多场景线上结果检验排序、整页生成和冷启动推理。
76ByteDance · ReSTFrom Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs针对行为噪声、稀疏监督和一份历史对应多候选的计算非对称,以推荐原生 Transformer 和共享前缀服务扩展工业排序。
77UNC Chapel Hill / Apple · CoGRIt Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning让查询侧与物品侧 LLM 交替用 GRPO 共同演化关键词表示,以倒排索引直接匹配并统一优化检索 F1。
78MatrixOrigin / Tsinghua University · ContextPipeContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents把 prompt 装配视为数据库查询执行,用确定性缓存感知优化器和 EXPLAIN ANALYZE 让长程 Agent 上下文可审计、可回放。
79Ant Group · AInfer-PDAInfer-PD: Communication-Safe In-Place Prefill-Decode Multiplexing for Distributed MoE Rollouts在共享设备与 KV 的前提下协调 prefill/decode collectives 并隔离 DeepEP 状态,降低分布式 MoE rollout 完成时间。
80Peking University · PISMaking Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents将延迟意图写成类型化记录,把生命周期逻辑交给代码、受限语言判断交给小模型,使前瞻记忆成为可执行状态机。
81Purdue University · OPSADoes On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement通过跟踪教师优势的噪声来源,论文发现 OPD 的主要收益更像在压低低概率尾部 token,并据此提出无需教师的熵自适应 OPSA。
82University of Texas at Dallas · ContextReuseA Universal Context-Reuse Layer for Cross-Model KV Sharing把一个模型产生的 KV 状态翻译给另一个模型消费,尝试将模型内缓存扩展成跨规模、跨架构与跨模型家族的上下文移动层。
83Argonne National Laboratory · AgentWorkingMemoryMeasure Before You Manage: Evaluating Agent Working Memory in Coding Agents将指令、代码工件、工具输出和 Agent 状态分开计量,揭示相同 token 预算并不意味着相同交付上下文、管理成本或任务结果。
84Alibaba Group · PAOLearning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval在文档索引不能重建的工业约束下,只保留正优势样本的拉近梯度,避免标准策略梯度把查询表示推离既有语义流形。
85Ant Group · PRIMEPRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert保留成熟 Dense 顶层网络作为锚点,以零初始化低秩残差专家做样本条件修正,在不破坏初始函数的前提下增加子群适配能力。
86Snap Inc. · SetMIRSetMIR: Multi-Interest Retrieval as Set Prediction用 Hungarian 一对一匹配抑制兴趣坍缩,再以存在分数和查询级 NMS 动态决定 ANN 调用数,把训练去重与线上预算控制连在一起。
87Tsinghua University / Tencent Youtu Lab · ContextPilotContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL把规划、记忆、卸载和上下文工具做成可学习动作,并用细粒度强化学习决定何时管理上下文;价值在于从被动截断走向主动控制,但评审器、算力公平性与长时漂移仍需单独核验。
88Tsinghua University · VICTVICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning把验证器反馈拆成可核验的推理原子与依赖边,再沿证明结构回传信用;它试图修正只看终局奖励的粗粒度训练,但收益依赖验证器质量与可解析任务结构。
89Cornell Tech · Speculative ProbingSpeculative Probing: LLM Monitoring at Speculative-Decoding Cost把已在服务链路中的 MTP 或 Eagle3 推测头变成序列探针,通过轻量 soft prompt 读取隐藏风险信号;低增量成本成立于既有推测头与 KV 缓存可复用的部署前提。
90Kuaishou Technology · HubMixerHubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation以少量可学习 latent hubs 完成诱导、交互和 token 条件回读,在更少参数下增强异构字段交互;线上 5.48% 提升只对应快手短视频招聘的简历投递转化。
91Nanjing University / ByteDance · Offline-MBRLLearning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning把激励承诺、延迟广告收益与短期延续效应建成序列决策,并用世界模型和独立反事实评分器做上线前筛选;正负线上结果共同显示离线排序不能替代覆盖与外推诊断。
92POSTECH · PMFRecPersonalized and Multi-View Representation for Federated Cold-Start Recommendation在服务端不可见交互、客户端不可见专有属性的双侧约束下,联合个性化编码、多视图门控与正交目标生成冷物品表示;联邦训练并不自动等于无表示泄漏。
93The Ohio State University · CritICLCritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes把同一家族小模型的真实错误整理成失败模式与批评库,再按错误机制检索给强模型;关键价值是用一次静态推理替代多轮采样,但跨家族迁移、建库成本与显著性边界必须单独核验。
94Southern University of Science and Technology · ES for LLM ReasoningUnderstanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO系统比较演化策略与 GRPO 的推理后训练动力学:ES 不只省去反向传播,还保持更广的答案覆盖;顺序式 GRPO→ES 展示了准确率与 Pass@K 多样性可以分阶段优化。
95Tsinghua University · INTENT-AS-A-TOOLINTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment把“声明当前意图”加入 Agent 动作空间,用调用概率形成逐 token 风险轨迹并触发在线反思;它提供低成本监控接口,同时也证明测量工具会扰动被测行为。
96AI VK · VK-GNNScaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling在 1.94 亿用户、280 亿边的好友图上,用多哈希身份嵌入、时间安全邻居采样和 CPU/GPU 解耦流水线把 GNN 推进生产;论文同时给出两周线上 A/B 与完整系统成本。
97Shenzhen Technology University · CoVeMemWhen Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems将 LightGCN 学到的用户—物品协同几何写入可训练向量记忆,再由 LLM 通过软 token 和 LoRA 读取,试图补足文本记忆无法表达的潜在偏好;效果与持久化成本仍主要停留在离线证据。
98National University of Defense Technology · PrismRecPreference Flow Matching with Spectral Factorization for Micro-video Recommendation先用频谱因子分解拆开多模态兴趣的共享与特异成分,再以条件流匹配生成连续偏好轨迹;方法在三个微视频数据集上保持优势,但尚缺代码与线上验证。
99Huawei Technologies Co., Ltd. · AsymSpecAsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMsAsymSpec 由华为技术有限公司 Sheng Liang 等人提出,合作机构包括中国科学技术大学。论文于 2026 年 8 月 26 日公开,作者在 arXiv 备注中标注为 EMNLP 2026 Main Conference;这一会议状态是作者提供的信息,不等同于本轮对会议录的独立核验。论文入口为 AsymSpec: Context-Asymmetr
100Aston University · ProgRouterProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost TradeoffsProgRouter 由 Aston University 的 Songyuan Li 与 Queen Mary University of London、University of Exeter 的合作者共同完成,公开于 2026 年 8 月 26 日;作者在 arXiv 备注中说明论文已被 EMNLP 2026 Findings 接收。论文研究的不是“收
101Clemson University · DualOPSDDualOPSD: Adaptive Privileged Teachers for On-Policy Self-DistillationDualOPSD 讨论的是大模型数学推理后训练中一个容易被忽略的角色分工:当学生模型沿自己采样出的轨迹学习时,使用参考解答作为特权上下文的“教师视图”是否也应该改变。论文由克莱姆森大学 Yutong Chen、Guangfu Guo、Kunpeng Liu 与犹他大学 Zhichao Xu 合作完成,于 2026 年 8 月 26 日公开于 arXiv:26
102AI at Meta · AMBERAn Event is Worth One Token: Event Tokenization for Industrial-scale LLM Recommendation这篇工作由 AI at Meta 的 Fan Xia 等 15 位作者完成,于 2026 年 8 月 24 日公开 v1,提出 AMBER(Autoregressive Modeling via Bottlenecked Event Representation)。它把用户一次互动时的异构时间快照压缩成连续 Event Token,再让自回归序列模型
103Renmin University of China · TransRetrievalTransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial RecommendationTransRetrieval 是中国人民大学高瓴人工智能学院郑智飞等人与阿里巴巴淘天集团合作完成的工业推荐研究,已被 CIKM 2026 接收。论文讨论的不是排序阶段再堆一层更大的网络,而是怎样让 Transformer 真正进入亿级候选的召回阶段,并在严格时延下同时利用异构字段和多业务域数据。论文唯一入口为 arXiv:2608.25528;截至本轮核验,
104Taobao & Tmall Group of Alibaba · DCEODCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search> 机构:阿里巴巴淘天集团 > 作者:Junzhao Zhang、Tao Zhang、Liren Yu、Feiyi Dong、Zhixuan Zhang、Dan Ou、Haihong Tang > 公开时间:2026 年 8 月 26 日 > 论文链接:arXiv:2608.25635 > 公开资源:截至本次调研,未核验到作者公开的代码、数据或项目页。
105National University of Singapore · RecurisRecursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses《Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses》由 Zhaochen Yu 等人完成,一作主机构为新加坡国立大学,合作机构包括斯坦福大学、牛津大学和普林斯顿大学。论文于 2026 年 8 月 25 日提交至 arXiv,主类别为 LLM,关注长
106Renmin University of China · SPO++SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL这篇论文讨论长轨迹 Agent 强化学习怎样摆脱“同一提示必须凑齐一组 rollout 才更新”的等待瓶颈。作者为 Kai Ruan、Jinghao Lin、Qianshan Wei、Ziqi Zhou 与 Zihe Huang;第一作者来自中国人民大学高瓴人工智能学院,合作机构包括独立研究者、中国科学院自动化研究所、杜克大学和中国科学院计算技术研究所。论文
107Zhejiang University · BrowserForgeBrowserForge: Scaling Web Episode via Parallel Browser SandboxesBrowserForge 是浙江大学与腾讯 LLM Department 合作完成的一项网页智能体数据工程工作,作者包括 Fei Tang、Huawen Shen、Zhiqiong Lu、Zhengxi Lu、Pengyuan Lyu、Chengquan Zhang、Weiming Lu、Jun Xiao、Yueting Zhuang 与 Yongliang
108Nara Institute of Science and Technology · UniSpecRecRethinking Semantic Alignment in LLM-Enhanced Collaborative Filtering: A Spectral Decoupling Approach这篇论文由奈良先端科学技术大学 Yedong Jin 等人完成,九州大学参与合作,研究对象是 LLM 语义表征如何进入通用协同过滤。作者没有再设计一个更复杂的“语义到行为”投影器,而是先追问对齐本身会留下什么、丢掉什么,再据此提出 UniSpecRec。论文于 2026 年 8 月 25 日公开在 arXiv:2608.24363;首页含 WSDM 2027
109Taobao & Tmall Group of Alibaba · Mine-Then-TrainNative Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce ScenariosChao Yi、Feifan Yang、Jiawei Feng、Sishuo Chen、Zhangming Chan、Xiang-Rong Sheng、Han Zhu 的这篇工作来自阿里巴巴淘宝天猫集团,一作主机构为淘宝天猫集团,合作机构包括中国科学技术大学与北京大学。论文发表于 CIKM 2026,公开版本见 arXiv:2608.24091,DOI 为
110Kuaishou Technology · TAGRTAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising《TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising》由快手科技 Wencai Ye、Guangyi Liu 等作者完成,合作机构包括清华大学;论文于 2026 年 8 月 25 日公开在 arXiv:2608.24034,
111Santa Clara University · MemRerankMemRerank: Preference Memory for Personalized Product Reranking把目标交互前的购买历史压缩为可跨查询复用的偏好记忆,再用冻结 LLM 的五候选重排效用和 GRPO 训练抽取器;宏平均与 held-out 检索器领先,但保留逐检索器负迁移边界。
112Korea University / KT Corporation · CAIROProfiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders把大规模商品元数据与评论结构化为客观特征和多面主观 trait,再按用户上下文选择真正影响当前重排决策的证据;直接注入全量字段反而通常损害效果。
113National University of Singapore · BPCOHow to Train a Critic Stably and Efficiently这篇论文由新加坡国立大学 Penghui Qi、Wee Sun Lee 与腾讯混元 Xiangxin Zhou 合作完成,研究对象是大模型推理后训练中的单轨迹 actor-critic。论文于 2026 年 8 月 24 日公开,唯一论文入口为 arXiv:2608.23566,作者代码仓库 gol
114Princeton University · PrimeAgentPrime Agent: A Self-Improving RLM HarnessPrime Agent 是一个面向长时程评测、编码与自动化研究的开源 Agent harness。论文第一作者 Seth Karten 的主要机构是普林斯顿大学,合作机构包括 Prime Intellect 和 MIT;全部作者为 Seth Karten、Alex L. Zhang、Kevin Th
115VIDRAFT AI Research / QuantumOS · PrefixAuditThe Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models这篇论文由 Taebong Kim 等人完成,一作主机构为 VIDRAFT AI Research / QuantumOS,于 2026 年 8 月 24 日以 cs.LG 为主分类公开。论文把自回归因果性写成一个可执行的前缀不变式,用两次前向传播检查未来 token 是否改变了任一层的前缀表示,并
116DeepFind Team, Ant Group · DensingLawTowards a Densing Law for User Representation Learning at Billion-Scale Capacity这篇论文由蚂蚁集团 DeepFind Team 的 Bin Dou 等人与浙江大学合作完成,于 2026 年 8 月 24 日公开,唯一论文入口为 arXiv:2608.23392。作者先用支付宝真实行为数据诊断“原始行为扩展墙”,再把用户行为转为 RQ-VAE 语义 ID,以效用—成本 Paret
117AI VK / Lomonosov Moscow State University · HEGMHierarchical Exponential-Gaussian Mixtures for Watch-Time Distribution Prediction这篇论文由 Sofia Gulevskaia、Mikhail Trapeznikov、Aleksandr Poslavsky 和 Alexander D'yakonov 完成,一作主要机构为 AI VK 与 Lomonosov Moscow State University。论文于 2026 年 8
118University of Science and Technology of China · SSTRethinking Item Tokenization in Generative Recommenders: From Fixed Atoms to Semantic Subwords这篇 CIKM 2026 论文由中国科学技术大学团队主导,合作机构包括华为技术有限公司。论文研究生成式推荐中一个容易被“语义 ID 已经足够紧凑”掩盖的问题:同一套固定长度 SID 同时承担目标物品标识与用户历史表示,两种职责对 token 结构的要求其实并不相同。作者提出 Semantic Sub
119中国科学技术大学 · AUSOAUSO: Action-Level Unified Skill Optimization from Internalization to Utilization- 论文:AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization - 作者:Huizu Lin、Chengkai Huang、Tianqi Gao、Tao Huang、Daijiao Liu、
120Quantify Labs Ltd · MemoryPoisoningUtility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking这篇论文由 Quantify Labs Ltd 的 Arulnidhi Karunanidhi 独立完成,于 2026 年 8 月公开。作者刻意选择最普通的攻击:把错误事实写成正常对话并存入 Agent 持久记忆。论文入口为 arXiv:2608.21230。本文也核对了 Aegis Memory
121Thomson Reuters · TreeWYTreeWY: Speculative Verification for Gated DeltaNet HybridsTreeWY: Speculative Verification for Gated DeltaNet Hybrids 由 Thomson Reuters 的 Sneha Murthy Ghantasala 撰写,2026 年 8 月 21 日公开,arXiv:2608.20961。它重写 Gate
122Netflix · RecommendationConcentrationRecommendation Quality and the Concentration of Consumption: Experimental Evidence from Netflix> 英文标题:Recommendation Quality and the Concentration of Consumption: Experimental Evidence from Netflix > 作者:Guy Aridor, Winston Chou, Nathan Kallus, A
123东北大学 · AdaptedKGAdapting Knowledge Graphs for Behavior Denoising in Sequential RecommendationAdapting Knowledge Graphs for Behavior Denoising in Sequential Recommendation 由东北大学的 Zichun Jin、Zihan Zhou、Yinan Liu、Bin Wang 与 Xiaochun Yang 完成,公开于 2
124快手 · DynamicSIDFrom a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation这篇论文讨论生成式推荐中的 Semantic ID(SID)应该怎样设计,作者 Tianlu Xie、Xin Ku、Mingjie Sun 等均来自快手科技,公开于 2026-08-21。论文把线上常见的“三 token:两层语义码 + 一层协同去重码”改成“两 token:一个大词表语义码 + 一
125Peking University / NVIDIA · MHLAMHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head / MHLA:用 token 级多头恢复线性注意力的表达力把线性注意力从一个共享全局 KV 摘要扩展为多个 token-level 局部摘要,以 Multi-Head Mixing 恢复 query 条件选择性,并在图像、视频和语言任务上验证线性复杂度下的表达力。
126Chinese Academy of Sciences · Memory-Augmented CoTMemory Augmentation Unlocks Efficient Chain-of-Thought Reasoning / 记忆增强解锁高效链式思维推理《Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning》研究如何在压缩 Chain-of-Thought(CoT)的同时保住复杂推理所需的信息。作者为 Simeng Zhang、Yilong Chen、Wenyuan Zhang、Zhenyu Zhang、Yao Chen、Junyuan Shang 与
127University of Washington · MidToolMidTool:面向 Agent 工具使用的中训练数据合成MidTool 研究的不是又一个工具调用后训练配方,而是一个更早的能力注入点:在通用预训练与 SFT/RL 后训练之间,用专门的工具使用语料做 mid-training。论文由华盛顿大学、Snowflake 与北卡罗来纳大学教堂山分校合作完成,一作 Fengqing Jiang 的主机构为华盛顿大学,其工作在 Snowflake 期间完成。论文于 2026-08-20 公开,入
128Xiamen University · SAPOSAPO:面向智能体强化学习的单轨迹自回归策略优化这篇论文由厦门大学梁大洋、刘云龙与南洋理工大学冯朗、安波合作完成,一作主机构为厦门大学。论文提出 Single-Rollout Autoregressive Policy Optimization(SAPO),目标是在一个因果语言模型里同时承载策略、状态值与动作值,从而保留 actor-critic 的时序信用分配,又不再维护独立的策略规模 critic。论文于 2026 年
129Korea University · SCoRDSCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based RecommendationSCoRD(语义辅助持续检索器—重排器蒸馏)研究轻量 ID 检索器高频更新、LLM 重排器低频更新时如何共同适应兴趣变化。作者为 Seunghyun Baek、Gyuseok Lee、Seunghan Lee、Wonbin Kweon、Dong Wang 与 SeongKu Kang;第一作者主机构是高丽大学,合作机构包括伊利诺伊大学厄巴纳-香槟分校与成均馆大学。PDF 标注
130DoorDash · Semantic Product IDOne Hierarchy, Two Systems:用同一套语义商品 ID 支撑发现页排序与搜索页查询改写这篇论文由 Steven Xu、Sanjyot Thete、Saathvik Dirisala、Raghav Saboo、Nimesh Sinha、Leo Shao、Elyse Winer、Sudeep Das、Martin Wang 和 Kyle MacDonald 合作完成,作者机构均为 DoorDash Inc.,前四位作者标注为共同贡献。论文收录于 First Work
131Meta · DASODifficulty-Aware Semantic-ID Optimization for Generative Recommendation / 面向生成式推荐的难度感知 Semantic-ID 优化作者: Xin Yu、Stephen Li、Sina Aghaei、Zifan Zhu、Jiamu Bai、Guanjie Huang、Bo Peng、Yiyao Liu、Lingzhou Xue 机构: Meta、宾夕法尼亚州立大学。第一作者 Xin Yu 同时署名 Meta 与宾夕法尼亚州立大学,论文注明本工作在其 Meta 实习期间完成。 公开时间: 2026-08-20
132University of Washington · SPADESPADE: Self-Play in Adaptive Synthetic Executable EnvironmentsSPADE(Self-Play in Adaptive Synthetic Executable Environments)研究的不是怎样再多合成一批题,而是怎样让“训练环境的设计”本身也成为可学习、会随智能体能力变化的过程。论文第一作者 Bo Liu 的主机构是华盛顿大学,合作机构包括斯坦福大学、
133Tsinghua University · GC-OPDBeyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning- 英文标题: Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning - 方法简称: GC-OPD(Group-Calibrated On-Policy Distil
134ByteDance · DART-SDDART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling AgentsDART-SD 的英文全题是 DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents。论文由 Hangrui Xu、Jiarui Wang
135Vietnam National University, Ho Chi Minh City · rEDMRecrEDMRec: Distilling Large Language Model Reasoning into an Editable Experience Memory for Recommendation> 论文:rEDMRec: Distilling Large Language Model Reasoning into an Editable Experience Memory for Recommendation > 作者:Hoang Hai Nguyen 等;第一作者主机构为 Vietnam
136University of Science and Technology of China · Think-to-PersonalizeThink-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval这篇论文研究本地生活电商搜索中的个性化召回:模型不再只把用户输入当成待编码的短字符串,而是结合购买历史,先生成一个表达潜在需求的 intent-enhanced query,再把它压入可做 ANN 检索的稠密向量。第一作者 Angqing Jiang 的主机构是中国科学技术大学,合作机构包括美团;论
137Xiaohongshu · OneModelOneModel: A Unified Foundation for Platform-Scale Multi-Scenario RankingOneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking 是小红书团队于 2026 年 8 月 19 日公开的 arXiv 论文。第一作者是 Yinqi Zhang,19 位作者的主机构均为小红书,涵盖算法、训练
138Microsoft · Agent Lightning v1.0Agent Lightning v1.0: Towards Harnessed Agentic RL它把部署时 harness 直接带入后训练,系统化拆出 request-response trace 到 RL 样本之间的正确性与调度问题,并给出可复现 coding-agent 证据。
139Qualcomm AI Research · MoNeMoNe: Modular Neural Memory for Efficient Long Context Inference它把一次性上下文预处理与多次查询解耦,并把快权重记忆以模块方式附着到冻结 Transformer,直接回应个性化历史、长文档与 agent 状态的 serving 成本。
140Google DeepMind · Debate TrainingDebate Training Reduces Reward Hacking in RLAIF它把 reward hacking 放进可验证数学任务中测量,并用弱 judge 下的对抗辩论检验 scalable oversight,而不是只比较 judge 分数。
141快手 / 北京大学 / 南京大学 · OGROnce Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs它同时改 SID 构造、列表级规划、位置级解码和策略对齐,并给出离线与线上证据,代表生成式推荐从单 item token 走向 slate utility。
142昆士兰大学 / 多校 · FLEXRecEmpowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation它用多层出口和输入自适应稀疏路由补偿小模型容量,同时保持可扩展的全库向量排序,是精度—延迟折中较清晰的 LLM4Rec 方案。
143Meta · Impression Share PredictionImpression Share Prediction: An Offline Evaluation Task for Ranking Systems它补上离线 accuracy 与线上资源/目标桶重分配之间的系统盲区,把 ranker、auction、pacing 和 capacity 放进同一可预测对象。
144Mistral AI / Mila / 蒙特利尔大学 · Le CritiqueLe Critique: Privileged Value Functions for LLM Reinforcement Learning用 privileged critic 和自适应 TETHER baseline 重新评估 value function 在现代 LLM RL 中的价值。
145中国人民大学 / IQuest Research · ClawGym IIClawGym II: Exploring Black-Box RL on Agent Harness在不改动复杂 harness 内部控制流的前提下,恢复可训练轨迹并支持 PPO、GRPO 与多 harness 联训。
146蒙特利尔大学 / Mila / Google Research · ProteusProteus: Incremental Memory Activation for Long-Context Sequence Modeling按上下文进度逐步解锁记忆容量,以早期压缩和后期新容量缓解静态记忆污染与覆盖。
147Meta · UniDotUniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation用共享 token 空间、双 bus 和 FM Highway 统一多域行为序列与多字段特征交互。
148Google · SDFDecomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay把内容陈旧拆成新内容继替与内在相关性衰减,在排序前用双过滤器主动剔除过时候选。
149北京理工大学 · SAHC-NSSAHC-NS: Structure-Aware and Hardness-Calibrated Negative Sampling for Implicit Collaborative Filtering联合候选池难度与 GNN 层间结构差异,按样本自适应校准负样本增强强度。
150IDEA Research / 香港科技大学(广州) / DataArcTech · Envs-FORGEEnvs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL用当前策略的 verifier reward 为每个 seed 选择增难、减难或多样化动作,并同步物化完整可执行环境。
151上海人工智能实验室 SU-01 团队 · SimpleOPDSimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning在共享文本 span 上对齐异构 tokenizer,并用终止 token 屏蔽与 reference KL 稳定长上下文蒸馏。
152中国科学院大学 / 清华大学 / 中关村学院 · AgentRewindAgentRewind: Recoverable Execution for Long-Horizon LLM Agents联合回滚 Agent 上下文和受控环境状态,并保留失败记忆,从一致检查点重启长程执行后缀。
153新加坡国立大学 / 腾讯 / 山东大学 · EchoRecEchoRec: Multi-Item Prediction-Empowered Generative Recommendation via Cycle-Consistent Preference Alignment把多 horizon 未来行为转成循环一致的整体偏好监督,并在推理时移除辅助训练支架。
154微软 · AdsWorldEngineAdsWorldEngine: A Self-Evolving Conversational Advertising Agent through Orchestrator and Tool Coevolution把机会判断、意图生成、工具调用和工具共进化统一进对话广告 Agent,并给出离线与线上证据。
155北海道大学 · Residual DominanceResidual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders用完整注意力块的范数分解与推理期残差缩放,解释序列推荐器的末项依赖。
156中国传媒大学 / 智联盈合科技 · RippleMemRippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory把长期记忆从一次性相似度检索升级为线索锚点与事件图上的目标导向联想扩展。
157国防科技大学 / 北京大学 · vTokenvToken: Token-Level Virtualization for Reclaimable KV Caches用 token-table 间接层和异步重排回收 KV block 内碎片,同时保持 PagedAttention 与 CUDA Graph 兼容。
158莱斯大学 / Microsoft Research · OpScaleOpScale: Operator-level Provisioning and Autoscaling for LLM Serving把扩缩容单元从整模型副本下沉到异构算子,以细粒度供给、放置和运行时调度降低 GPU 成本。
159独立研究者 / 筑波大学 · DrIGGenerative Universal Multimodal Retrieval with Dual-role Identifiers让同一组 residual-quantized identifier 同时承担有序生成目标与无序相关性先验,并以稠密相似度重排。
160清华大学 / 北京大学 · STARSTAR: Structured Tokenization and Target-Aware Interest Representation for PCVR Prediction通过高基数信号恢复、目标感知序列 query、交互 token 与加权对比目标提升挑战赛 PCVR 排序。
161南开大学 · FSGRFSGR: Mitigating Token Frequency Bias for Fair SID-Based Generative Recommendation从 SID 分配与层级频率校准两端缓解高频 token 过预测、低频 token 欠预测,改善长尾曝光公平性。
162浙江大学 / 中国科学技术大学 · GALLMMaking Collaborative Signals Count: Graph-Aware Large Language Models for Sequential Recommendation把全局协同关系直接写进大模型注意力偏置,解决语言语义与跨用户行为结构之间的表示错配。
163上海交通大学 / 美团 · HCGRecHCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs用最短目标前缀把不可达的 Semantic ID 奖励重新拉回可学习区域,并拆开 oracle prefix 与 sampled suffix 的 credit。
164浦项科技大学 / UIUC · PRISMFrom Overlooked to Explored: Recovering Item Relations via Mixture of Perspectives for Sequential Recommendation从点积注意力的相似性偏置出发,用多个关系视角恢复被压低的异质物品线索。
165约翰霍普金斯大学 · Information Abundance ParadoxInformation Abundance Paradox: Long-Context Training Undermines Parametric Knowledge揭示训练上下文过于充足时,模型可能把学习压力从参数内化转向上下文化,并在缺失或冲突证据下失去鲁棒性。
166浙江大学 / Microsoft / 多校合作 · QV-PICQV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving把渲染文本压缩、位置无关缓存和查询感知双分辨率预算合并,改善 RAG 的质量—首 token 时延折中。
167Bricks Technology · Agentic Memory CostTotal Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems把 Agent 记忆从准确率竞赛拉回端到端服务经济性,统一测量内部调用、盈亏平衡点与每个正确答案成本。
168南京理工大学 · R-OPSDTest-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation它研究部署后、无人工真值条件下如何让 GUI Agent 从失败交互继续学习,并把反思从提示层转成模型权重更新,兼具 Agent 学习机制与安全边界价值。
169南京大学 / 阶跃星辰 · MISA-TScheduling Mixed RL Rollouts Beyond Prefix Locality它触及大模型后训练的真实瓶颈:共享推理池既要提高缓存复用和吞吐,又不能因为某类长驻留会话挤占 KV 而悄悄改变训练数据分布。
170微软印度研究院 · Cross-Lingual Policy RetentionActions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using AgentsAgent 的成本、失败方式和可审计性由行动链而非最终措辞决定;该工作给出大规模、带 chance floor 与 self-consistency 上界校正的测量框架。
171Yandex Music · SonaSona Technical Report它提供少见的生产证据:生成式推荐不是作为级联旁路,而是端到端替换成熟音乐推荐链路,同时披露训练、蒸馏、语义 ID、在线服务与多轮 A/B 演进。
172台湾大学 · Tie-Aware GroupRecAre We Really Making Progress in Group Recommendation? Unmasking the Tie-Breaking Illusion它不是再提出一个模型,而是证明近年多项群组推荐增益可能受评测伪影影响;对任何使用低精度分数、量化打分或大候选集的排序系统都有直接审计价值。
173阿姆斯特丹大学 / 香港大学 / 奥胡斯大学 · TimeRouteTimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation它把多模态推荐中常被静态融合掩盖的时间尺度错配显式建模,并用路由、图重建和统计检验共同回答不同用户何时应该信任哪种模态。
174香港大学 / 中国科学技术大学 / 香港中文大学 · TIDE-OPDMismatch Matters: On-Policy Distillation Beyond Token Agreement把教师—学生失配拆成 excess 与 deficit,以有界 Hellinger 抑制和教师 top-K 解析恢复修复 OPD 的退化一致与覆盖缺口。
175淘宝天猫集团 / 武汉大学 / 香港大学 / 剑桥大学 · MetaStrategyMetaStrategy: Generative Ranking with Executable LLM Strategies让 LLM 生成受 schema 约束、可验证和可编译的联合排序策略,由隔离 Generator 在既有列表级 Evaluator 下与生产策略原子竞争。
176浙江大学 / 阿里巴巴 · SpecFormerSpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation以可学习频谱软化、频谱残差位置编码和原空间残差,缓解推荐 Transformer 的嵌入与注意力坍塌并恢复深度扩展。
177AI at Meta · LoopFMLoopFM: Learning frOm HistOrical RePresentations of Foundation Model for Recommendation把离线 FM 的历史中间表征压缩并组织成 VM 序列特征,审视标量蒸馏互补性、转移率理论与生产边界。
178LinkedIn · Feed SRAn Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking以帖子—动作交错序列、晚融合和共享上下文批处理,在 12 亿成员规模下替换 DCNv2 Feed 排序器。
179Moonshot AI / 月之暗面 · Kimi K3Kimi K3: Open Frontier Intelligence把 KDA、AttnRes、896 专家 MoE、多 effort RL 与百万 token 状态管理连接成 3T 开放权重模型的端到端扩展方案。
180Princeton / MIT CSAIL / Meta AI · GambitThought-Level Beam Search for Reasoning它不是只减少无效采样,而是把被释放的计算真正重投向更可能成功的前缀,并把准确率、token、吞吐和显存约束放在同一个系统口径下评估。
181中科院软件所 / 国科大 · EasyBalanceEasyBalance: Cross-Layer Load Balancing in Distributed MoE Inference它从运行时调度而非改模型映射解决 expert-parallel 尾部设备拖慢问题,适合输入分布频繁变化、不能为每个任务长期重排专家的在线推理。
182USC · PSEPersistent Semantic Entities in Tool-Augmented LLM Systems它指出 Agent 的安全边界不能只看当前 prompt 和显式 memory:工具注册表、回调和序列化状态可能让语义污染在会话结束后继续存活并沿多 Agent 链路放大。
183淘宝 / 阿里巴巴 · DREAMDREAM Technical Report它给出 Agentic RecSys 如何进入真实大规模级联链路的完整控制面,而不是让 LLM 直接生成 item;同时披露淘宝首页多阶段 A/B 结果与服务安全机制。
184快手 · PushDualGenPushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation论文把生成式推荐落到近十亿用户、约 100K QPS 的主动触达场景,明确处理 CoT 可解释性与线上时延之间的冲突,并给出满意度和长尾生态指标。
185阿里 / 高德 · IntHQIntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation它直面工业生成推荐从单目标 next-item 扩展到多目标漏斗时的表示稀释、静态关系和层级错配,并给出高德真实旅行推荐部署结果。
186UCSB / Hanbat · CoinRAGCoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG它同时处理 RAG 的证据噪声、在线 prefill 延迟与上下文化表示丢失,且用 P99 TTFT 预算而不是平均延迟给出完整 Pareto 证据。
187长沙理工 / 上海交大 · TEPATEPA: Revoking Stale Memories for Conflict-Robust Language Agents相比继续改相似度或摘要器,TEPA 把 Agent 长期记忆中最关键的陈旧知识问题提升为生命周期操作,并给出反转环境、真实文件执行和偏好更新三类证据。
188港科大 / Macau University · SkillProxSkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent它正面处理技能演化中的两个工程顽疾:未经结果验证的文本更新,以及只增不删导致的规则冲突和上下文膨胀。
189ByteDance · TM20KTeacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation这是少见同时给出 20K 行为序列、训练/显存/服务代价和真实电商广告线上指标的工业长序列方案。
190Meta · MISOMISO: Model-Internal-State-Guided Optimization for Ranking Models它研究的不是一次性新塔结构,而是工业 ranking family 如何持续决定扩容、替换和退役,直接针对昂贵 ablation 与黑盒搜索。
191NAVER WEBTOON · Progressive AlignmentProgressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training它把推荐 FM 的任务适配与业务指标对齐明确分开,并用离线消融和一个月大规模线上 A/B 检验后训练阶段的增量价值。
192IIT Roorkee / IIT Delhi · QEvictQEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding以全精度、可恢复 INT2 与永久淘汰三层动态路由,修复长上下文中注意力重要性漂移。
193SUAT / Ant Group · LUNARLUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs用现实分布锚定的合成跨域行为日志,评测证据选择、记忆压缩与隐私边界。
194上海交大 / 腾讯 · EnvACEEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning让同一 Agent 在训练中交替行动与复演环境响应,把世界模型内化进策略参数。
195杭电 / 网易伏羲 · Modal Weight AuditIs Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders用全局权重与用户置乱双对照,区分身份可识别、内容增益和真正有用的个性化。
196Yandex · Gryphon-v2Gryphon-v2: One Model in Place of a Cascade - Generate-and-Rank Recommender with Rollout Distillation共享历史编码器统一 Semantic-ID 生成与排序,以 rollout 蒸馏单模型替换生产级联。
197University of Innsbruck · EXCISEEXCISE: Query-Side Exclusion for Late-Interaction Retrieval只在查询侧识别排除主题并降权,冻结 late-interaction 索引而避免普通检索退化。
198Meta · NEXTNEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model先从当前视频推断下一步意图,再检索并验证逻辑承接视频;用离线 NKG 把 8B VLM 推理接入生产召回。
199Inria / Lille · Reasoning CoreReasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training把程序生成器、规范答案、语义评分、难度分布与仓库审计放进同一训练数据设计闭环。
200Princeton · Skill EntropyToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning用有方向的技能切换熵刻画长程任务难度,并把该尺度转成强化学习奖励。
201上海交大 · ABSeekerABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment从已验证答案逆向恢复证据线索,把终局成败拆成搜索轨迹的逐步密集信用。
202京东 · DEGRDEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging在即时点击与后续请求探索之间自适应分配权重,把重排从单请求最优扩展到浏览期权。
203Twitch / Amazon · Multi-Objective RankingMulti-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting把标签成熟时间、任务共享边界和用户生命周期分群拆成可独立上线的排序改造。
204电子科大 / 快手 · GOALGenerative Optimization for Incentivized Advertising with Global Level Constraints把重尾激励金额表示、局部疲劳、长程依赖与全局 ROI 压力统一为条件序列生成。
205美团 · SIFSample Is Feature: Beyond Item-Level, Toward Sample-Level Tokens for Unified Large Recommender Models把完整历史 Raw Sample 压成离散 Token Sample,再用行列分解 Mixer 统一样本内特征交互与跨样本时序建模。
206ByteDance · IATIAT: Instance-As-Token Compression for Historical User Sequence Modeling in Industrial Recommender Systems把每次历史排序实例的数千维特征压成高容量 InsEmb,并以 user-order SIT、双存储和多场景线上 A/B 验证工业可行性。
207人大 / 百度 · TurnSightTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning用执行结果可见的后见教师把长工具轨迹的终局信用拆到每轮,并以跨前视一致性约束自蒸馏信号。
208上交 / 上海 AI Lab · PI-MemPI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory让所有文档分块并行读取同一记忆,再迭代合并证据与提前停止,把长上下文推理扩展到 360 万 token。
209北大 / 通研院 · ContinualSkillBenchContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?以 500 个连续任务拆开上下文适应、技能库维护和独立复用,检验 Agent 是否真的形成持久技能。
210Sony Research India · ATLASATLAS: Learning to Recommend Across Unseen Domains在多源域上联合学习领域不变物品表示、用户几何与共享离散支持,冻结后直接服务十个未见推荐域。
211中科大 / 快手 · SITASITA: Semantic Interest Tokens for Target-Aware Compression in Long-Sequence Recommendation以语义兴趣 Token 离线压缩长历史,再由候选语义标识符做有界目标检索,兼顾个性化与在线成本。
212厦大 / Shopee · KGDKnowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation用 session 边界清理行为监督,并把可刷新预训练知识与下游任务几何解耦,减少流式迁移中的参数覆盖。
213Snap · SnapLGRLLM-Based Generative Retrieval for Snapchat Content Recommendation把多模态语义 ID、协同信号、词表落地、LLM 训练与 TensorRT-LLM 批量生成串成生产级召回链路。
214NatureSelect.AI / SUSTech · LiveMemLiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference以固定容量 GDN2 状态承接被驱逐 KV 的长期信息,让长时推理从反复重建记忆转向持续更新状态。
215Qwen Team / XLang Lab · Qwen-CUAQwen-CUA: Native Computer Use for (almost) Everything以截图、鼠标和键盘作为原生接口,结合大规模交互环境、长程上下文压缩与安全后训练训练通用电脑操作 Agent。
216Meituan LongCat · LongCat LSALongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing以流式感知、跨层复用和层次化索引把稀疏注意力扩展到百万 token,并联动训练、内核与 KV 系统。
217ByteDance / Peking University · STEPSA Self-Triggered Agentic Push Recommendation System让推送系统联合决定是否发送与何时再次唤醒,以规划、执行、过滤三 Agent 减少轮询计算并控制用户打扰。
218Zhejiang University / Ant Group · SmartGRSmartGR: Hierarchy and Beam-Aware Knowledge Distillation for Generative Recommendation面向生成式推荐的层次路径和 beam search 暴露做蒸馏,在保留教师排序能力的同时提升小模型推理速度。
219Anonymous manuscript · GRACEGRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval以目标感知 SID 树、分层头和 GPU/CPU 协同解码,把千万级广告生成式召回压进实时服务预算。
220香港理工大学 · KnowActKnow It, Act on It: Investigating Memory Utilization in LLM Personalization用配对 Know/Act 测试把偏好召回与行为利用拆开,定位个性化 Agent “记得却不用”的失败断点。
221Amazon AGI · Data TurnstileData Turnstile: A Scalable Open Framework for Function-Calling Data Generation从 API 规范逐步生成、校验并纠错多轮工具交互,用高质量合成数据提升小模型函数调用能力。
222Arizona State University · TokTierTokTier: Exact Stateful Tokenization for Agentic LLM Serving复用会话分词状态并以稳定边界证书保证 token ID 精确一致,把长上下文 Agent 的重分词移出 TTFT 热点。
223淘宝闪购 / 阿里 · GALAGALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System以搜索三元组预训练、转化奖励 GRPO 和自适应门控连接多模态内容理解与生产排序目标。
224Georgia Tech / Kuaishou · RecHarnessRecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems用 bandit 分配有限试验预算,再让 LLM 在受控方向内提出假设和代码修改,并以失败记忆触发结构跳跃。
225京东零售 · OxygenREC-v2OxygenREC-v2: Internalize Discrimination into Generative Recommendation (IDGR)把行为标签写进 decoder prefix 与行为加权预训练,配可验证奖励与熵感知特权蒸馏,在京东 6 场景取得 UCTCVR 与 GMV 提升。
226香港大学 / 多校 · OSRewardOSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models系统评估跨平台 CUA 轨迹判定,并以开放数据训练低成本奖励模型。
227NYU / Matterstack · AskChemAskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis把文献检索单位下沉到带 DOI 与证据定位的原子 claim。
228UIUC / Microsoft Research / Google DeepMind · ReTokenReToken: One Token to Improve Vision-Language Models for Visual Retrieval用单个检索 token 从视觉 KV cache 稀疏选取查询相关视觉 token。
229西交利物浦 / 小红书 / 北京大学 · HiLaRHierarchical Latent Reasoning for LLM-based Recommendation以粗到细偏好层次对齐 latent reasoning,并用逐层过程奖励分配信用。
230华中农大 / 复旦 / 快手 · FeedbackPolicyFrom Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation用结果反馈发现推荐策略,再蒸馏进轻量 SID 生成器。
231Teads · OpenWebUFMBuilding a User Foundation Model for the Open Web在身份碎片化、历史缺失的开放网络 RTB 中预训练用户基础模型。
232腾讯 · CCFormerCCFormer: Efficient Cross-Field Interaction and Hierarchical Sequence Compression for Industrial Recommendation at Tencent用字段分离交叉注意力和分层压缩兼顾长行为序列、训练吞吐与线上推荐收益。
233Meta AI · ROCSROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation把共享计算提升到请求级,并以层掩码、跨候选注意力和内核广播提高大规模推荐吞吐。
234Google Discover · HA-MoEHeterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study让 MoE 门控与专家感知异构任务,并用 LENS 诊断工业多任务排序中的专家分工。
235马里兰大学 · β-OPSDβ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation从 KL 正则策略优化推导可调 β 的几何目标,用 token 级自蒸馏改善数学推理。
236Cornell / UIUC · MANTAMANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems让多 Agent 系统在推理时审计并局部改写角色、通信边、顺序和可见性。
237Frontis.AI / 清华 · Frontis-MA1Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering在 5,758 个可执行 MLE 环境中训练 AI4AI 模型,再以长程进化搜索继续提升。
238北京大学 / 阿里巴巴 · GEARCopy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning诊断长上下文思维链的重复抄录,用关键证据奖励与干扰惩罚提升 grounding,并在更长上下文取得更大收益。
239Meta AI / Columbia · OC-GRPOOff-Context GRPO: Learning to Reason on Hard Problems using Privileged Information用特权指导 rollout 跨过零奖励学习断崖,再以重要性校正回到无指导目标。
240南京大学 / 华为 · AdaFlashAdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters以在策略蒸馏稳定扩散草稿器,并按 token 质量自适应调节验证长度,提升高并发吞吐。
241浙江大学 / 淘宝天猫 · TSGRTSGR: Taobao Search Generative Retrieval把查询条件的业务价值同时写入并行 Semantic ID 与联合预排,在淘宝搜索完成离线与线上验证。
242中国科学技术大学 · DDMSRBeyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation在商品语义图做拉普拉斯低通,在行为序列做可学习频域过滤,联合去除特征与交互噪声。
243UIUC · TopoTokTopology-Aware Tokenization for Generative Recommendation用群组间、组内与商品级三级蒸馏守住量化前语义拓扑,改善生成式推荐的离散 token。
244UIUC · PagedWeightPagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization把专家权重 bit-plane 分页,随 KV cache 压力动态调整位宽,在质量、显存与吞吐之间做在线控制。
245NYU / 多校 · Pre2Post ReasoningUnderstanding Reasoning from Pretraining to Post-Training用棋类可控试验台贯通预训练、SFT 与 RL,量化先验如何决定后训练收益。
246Penn State / Waterloo · ToolSciVerToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning把表格聚焦、图表解析和区域缩放做成类型感知工具,再用 GRPO 学习证据获取策略。
247Taobao / Alibaba · RecGPT-V3RecGPT-V3 Technical Report以持续用户记忆、文本与语义 ID 混合建模、潜变量意图推理,把大模型推荐推进淘宝线上服务。
248USTC / Kuaishou · RECAPRECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation把语言画像变成容量受限的流式状态,并用隐式推荐反馈闭环优化画像更新器。
249University of Queensland · Layer-Wise RelevanceLLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal沿层深训练线性探针,定位相关性何时可解码,并检验内部信号能否跨语言迁移。
250MindLab / 复旦 · LongStrawLongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget捕获共享超长 prompt 状态并串行重放响应分支,把固定 GPU 预算下的 RL 执行路径推到 210 万 positions。
251Alibaba · PReMPReM: Learning What to Preserve and When to Refresh for Context Compression以逐层 KV memory 和生成期刷新 token,把一次性上下文压缩改成可学习的动态记忆更新。
252清华 / 多校 · SEEDSEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning从 on-policy 轨迹提炼后见技能,再把行动概率变化蒸馏成 token 级训练信号。
253Yandex · Long-History TransformerLong-History User Transformers for Real-Time Ad Ranking把 8192 条用户历史拆成离线全历史缓存与在线短窗,在不增加延迟下提升广告排序与收入。
254Pinterest · Causal RetrievalDeep-learning Causal Retrieval Optimization for Efficient e-commerce Distribution in Pinterest以随机化日志、双重稳健学习和离线回放决定是否触发 Shopping Candidate Generators。
255Pinterest · Downstream RewardsLong-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning把可早期观察的留存代理奖励接入不同排序模型,并部署到四个 Pinterest 业务面。
256University of Wisconsin-Madison / Microsoft Research · TRACETRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents用冻结参考模型估计答案可预测性的逐轮变化,把终局奖励拆成工具级信用。
257RELAI.ai · Continual LearningDo Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0用两阶段 Terminal-Bench 任务流检验 Agent optimizer 的收益累积与旧能力回归。
258宁波东方理工 / 香港理工大学 · PosConfPost-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration把后训练后的置信度拆到推理前、中、后三阶段,并按可靠位置做早停和聚合。
259东南大学 / 淘宝天猫 / 北京大学 · TMallGSTMallGS: Scaling Unified Feature and Sequence Modeling for Generative E-commerce Search以统一异质序列、显式交叉旁路和逐层监督扩展电商搜索精排 Transformer。
260Apple · HybridVideoSearchPersonalizing Incremental Video Search with Hybrid Text and ID Embeddings把语义 TextEmb 与协同 IdEmb 注入增量视频搜索,改善短前缀歧义排序。
262University of Tennessee / Microsoft · E3Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution用最低充分执行、ACRR 与验证失败后的逐级扩域,让 Agent 把成本花在任务真正需要的范围。
263MemTensor / HKUST(GZ) / RUC · MemOpsMemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations把记住、遗忘、更新、反思和状态轨迹拆成操作级探针,定位长期记忆系统的真实失效环节。
264Waterloo / UBC / NVIDIA · FIMMidtrainingFunction-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models从程序依赖图选择难而可恢复的函数缺口,用普通代码自监督预训练 Agent 消费 observation 的结构能力。
265Meta · SlimPerSlimPer: Make Personalization Model Slim and Smart固定大小 user-item 知识库逐层选择、匹配和细化原始用户 token,并在请求内共享用户侧计算。
266Meituan · NONTPNot Only NTP: Extending Training Signal Coverage for Generative Recommendation用多步未来对比目标与跨域第二梯度路径补足 NTP,同时保持线上推理图不变。
267Pinterest · MESHMESH: Scaling Up Retrieval with Heterogeneous Content Unification以模块化语义域、门控偏差校正和异步服务统一 fresh、long-tail 与 evergreen 的大规模召回。
268Baidu / Shandong · SCOPE-RLSCOPE-RL: Optimizing Reasoning Paths Before and After Success用成功前前缀奖励暴露先决进展,再用正确性门控过程奖励压缩成功后的冗余推理。
269Alibaba / MBZUAI · UnfairJudgeInside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias从低维激活方向解释 judge 偏差,并以 activation steering 实现攻击、修复和跨基准预警。
270FusionBrain / RUDN · ARMTExtending LLM Context via Associative Recurrent Memory用段内全注意力与段间关联循环记忆,以常数级状态扩展现有 LLM 的长上下文。
271JD.COM · MMRMMMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search共享多模态骨干配合任务特定 token,一次推理生成服务多任务排序的多路商品表征。
272Glasgow / Telefónica · StresaStream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation用历史侧流融合和选择性残差更新,缓解冻结多模态 embedding 的深层适配退化。
273DTU / JP-Politikens · ZoRROZoRRO: A Zero-Weight Personalized Recommender System for Scalable News Recommendation以时效性和语义相似度构成免训练新闻推荐器,兼顾在线效果、速度和超越准确率指标。
274UNHCR / CNR · WorkflowKnowledgeWorkflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows把工作流定义、实例、推理记录与上下文快照提升为可查询、可恢复的持久知识对象。
275PwC · Citation VerifierDo You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution校准 citation judge 的 F1 与方向性偏差,防止把有偏 rubric 分数直接当作强化学习奖励。
276上海交大 / 阿里 · SMetricSMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling按会话首轮做负载均衡、后续轮次做 cache-aware 路由,提高 Agent serving 的吞吐与缓存复用。
277Northeastern University · City VisibilityLarge language models create an uneven informational layer over cities审计 LLM 餐厅推荐中的幻觉、不可见与人口属性分层,揭示候选集生成的城市分配风险。
278KAIST / Gaudio Lab · VTMRMultimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking用多模态语义召回加时序 cross-encoder 重排,把视频到音乐匹配从全局相似推进到局部动态对齐。
279Northeast Normal University · SSC-LoopSigned-Graph Recommendation as Structural Consistency Maximization联合修正 signed graph 的结构、传播与语义一致性,提升信任/不信任社交推荐。
280HKU / 美团 · UniClawBenchUniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks把 proactive agent 评测从沙盒单轮推进到 live Docker、闭环多角色和五项能力归因。
281Meta AI · Proactive MemoryRemember When It Matters: Proactive Memory Agent for Long-Horizon Agents让独立 memory agent 决定何时向 action agent 注入有证据的提醒,缓解长程执行状态衰减。
282Manitoba / UCF · QuantEquivThe Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs用 correctness agreement 与逐层分布漂移证明低比特模型即使准确率相同也可能行为不同。
283Amazon · BACHBACH: A Bayesian Admixture of Contrastive Heads for Multi-Interest Two-Tower Retrieval用每用户贝叶斯兴趣混合替代多兴趣双塔的硬路由,缓解 head collapse 并保留 ANN 服务。
284阿里 · DaV-GenDaV-Gen: End-to-End Generative Retrieval via Draft-and-Verify在单模型中联合训练向量 draft 与生成式 verify,统一搜索/推荐的召回与排序目标。
285人大 / 快手 · PIT-SUNPIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems用经验 PIT 坐标、SUN 期望恢复和 CDF 漂移监控稳定重尾、零膨胀价值回归。
286Cornell · Co-LMLMCo-LMLM: Continuous-Query Limited Memory Language Models把 LMLM 的关系型知识库升级为连续向量查询和可归因文本记忆,连接预训练知识控制与 RAG。
287Qualcomm · LinearizationThe Key to Going Linear: Analysis-Driven Transformer Linearization从冻结 backbone 机制分析出发解释 Transformer 线性化为什么会丢质量,并给出 sink token、短卷积和 cache routing 修正。
288清华 · SAOSingle-Rollout Asynchronous Optimization for Agentic Reinforcement Learning把长程 agentic RL 从同步批处理推进到 single-rollout asynchronous optimization,降低等待和 off-policy 漂移。
289清华 / 多校 · MMEACRSeeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation用多模态证据、记忆演化和 agent 协作改进 LLM4Rec 的偏好建模与可解释推荐。
290Amity · LBMLarge Behavior Model: A Promptable Digital Twin of the Retail Customer把零售客户建成可提示的行为数字孪生,服务推荐、促销和营销决策中的用户建模。
291Sheffield / Bloomberg · COPEWhen and How to Ask: Dynamic Preference Elicitation Strategies for Conversational Recommendation研究对话推荐中何时询问、如何询问偏好,把 elicitation strategy 接入推荐和回复生成。
292上海交大 / 多校 · DynaKRAGDynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation把 multi-hop RAG 的检索、gap query、bridge expansion 和 stop 统一成可学习 evidence-control 策略。
293清华 · CompactionRLCompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents用强化学习联合优化长程 Agent 的任务执行与上下文压缩摘要,缓解有限上下文窗口。
294林茨大学 · KVpopKVpop -- Key-Value Cache Compression with Predictive Online Pruning用 future-attention 监督在线 KV cache 淘汰,在高压缩率下尽量保持长上下文推理性能。
295阿里淘宝天猫 · CanniUpliftCanniUplift: A Holistic Framework for Mitigating Seller and Incentive Cannibalization in E-commerce Uplift Modeling把卖家互抢和激励互抢纳入电商 uplift modeling,服务平台级增量 GMV 优化。
296多校 · InfluMatchInfluMatch: Frontier-Quality KOL Search at 4B-Model Cost用 dense retrieval、4B reranker 和 4B reasoner 做 KOL 搜索级联,以小模型成本逼近 frontier 质量。
297多校 · PathologicalRecPathological Regimes of Closed-Loop Recommendation Systems over Social Networks把闭环推荐写成无限时域状态反馈控制问题,分析极化、失稳和不可达最优的病理 regime。
298UCR / Meta AI · SCOReDSCOReD: Student-Aware CoT Optimization for Recommendation Distillation用学生模型注意力、答案概率和困惑度优化推荐 CoT 蒸馏轨迹,压缩重复验证并提升小模型排序可靠性。
299UC Berkeley / Stanford · LLMVerifierLLM-as-a-Verifier: A General-Purpose Verification Framework把离散 LLM judge 改成连续概率 verifier,服务 agent 排序、进度估计和 RL dense feedback。
300LMU Munich · MetaSkill-EvolveMetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution把 agent skill rewriting 推进到递归层:任务技能快循环演化,改进技能慢循环自我演化。
301ByteDance / Tsinghua · Direct-OPDWeak-to-Strong Generalization via Direct On-Policy Distillation用弱 teacher 的 RL-induced policy shift 指导强 student,在强模型自己的轨迹上做 dense distillation。
302Zhejiang University · LBRLBR: Towards Mitigating Length Bias in Large Language Models for Recommendation定位 LLM4Rec 的长度偏置,用 attention calibration 和 effective information length normalization 修正推荐分数。
303Alibaba · UniSGRUniSGR: Unified Framework for Semantic ID Generation and Ranking把语义 ID 生成和多目标排序统一起来,补生成式召回难以承接细粒度排序的问题。
304UNSW · ChronoSIDBeyond Item Order: Temporal Gap Tokenization for Generative Recommendation with Semantic IDs把交互时间间隔作为生成式推荐输入 token,让 semantic-ID 序列模型感知兴趣连续性和漂移。
305山东大学 · ColdGenRecCold-Starts in Generative Recommendation: A Reproducibility Study在统一用户/物品冷启动协议下复现多类生成式推荐器,拆解模型规模、标识符设计和 RL 训练对冷启动泛化的真实影响。
306Meta / UNC · Diffusion-GR2Diffusion-GR2: Diffusion Generative Reasoning Re-ranker把自回归生成式推理重排器改成块扩散解码,用 CFT、OPD 和 RL 追回排序精度并提升解码吞吐。
307University of Toronto · HNSW SpannersHNSW with Accuracy Guarantees Using Graph Spanners用 Certify-then-Rectify、统计认证和 graph spanner 估计给 HNSW 检索补最坏情况准确性保护。
308UMD · AgenticSearchEOBringing Agentic Search to Earth Observation Data Discovery把 NASA EO-KG、神经检索、BM25 融合和 LLM agentic reranking 接成地球观测数据发现系统。
309BNU · CheckRLMCheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning从推理链抽取事实声明并用 RAG 做知识-思维一致性检查,低成本修正长程推理中的事实漂移。
310Alaya Lab · AgenticSTSAgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents把长程 Agent 记忆定义成 typed retrieval 的有界契约,并用 Slay the Spire 2 建可复现实验床。
311Amazon · DRIFTLENSDRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models度量用户记忆注入如何改变个性化语言模型的推理轨迹,并比较 DPO/GRPO 缓解效果。
312AI VK · MF-MDPPlanning over Matrix-Factorization MDPs for Candidate Generation把静态矩阵分解 top-K 召回改写成 fold-in posterior 上的短程规划问题。
313eBay · IntentTuneIntentTune: Using User Demand and Personalization to Resolve "Unknown" Query Intents for E-commerce Search用用户历史搜索、浏览和 profile 信号消解电商短 query 的未知意图,服务召回前意图补全。
314Virginia Tech · Bi-NASBi-NAS: Bi-Level Neural Architecture Search for Explainable Recommender Systems用双层神经架构搜索优化推荐解释结构,并用 LLM zero-shot 生成个性化解释。
315McGill · LACUNALACUNA: Distinguishing True Forgetting from Output Suppression in LLM Unlearning给 LLM unlearning 增加参数级定位真值,区分真正擦除与输出层混淆。
316UIUC · ReContextReContext: Recursive Evidence Replay for Long-Context Reasoning用训练免费的递归证据重放提升长上下文推理中的 evidence utilization。
317SUFE · HOLAA Hippocampus for Linear Attention: Memory-Augmented Linear Transformers给线性注意力增加有界精确 KV cache,补足 recurrent state 遗忘的关联。
318VaidhyaMegha · ANNRepairWhen to Repair a Graph ANN Index: Navigability-Signal-Triggered Local Repair Protects Tail Recall Under Bursty Churn把向量检索索引维护从固定节奏 consolidation 改成可导航性信号触发的局部修复,直接服务 RAG、搜索和推荐召回的 tail recall 稳定性。
319Meta · GOOBSReal-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval用 LLM 表征构造在线 hard-negative pool,补齐双塔召回训练中“负样本既要难又要可在线更新”的工业问题。
320Spotify · As It WasAs It Was: Aligning LLM Search Evaluation with Historical User Preferences把历史行为偏好注入 LLM 搜索评价器,解决语义相似度式 judge 与真实用户偏好不一致的问题。
321厦门大学 · MemSyco-BenchMemSyco-Bench: Benchmarking Sycophancy in Agent Memory把长记忆 Agent 的风险从“能否检索到记忆”推进到“检索到的记忆是否会误导当前推理”。
322Stanford · AutoMemAutoMem: Automated Learning of Memory as a Cognitive Skill把 agent memory 从外挂检索模块推进到可自动搜索、可训练、可复用的认知操作技能。
323复旦 · PlanRAGWhen RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning Problems把数据库 query planning 思路引入复杂自然语言问题,用逻辑查询树重排 RAG 的检索和推理执行顺序。
324阿里 · ShopXShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping近期最直接的工业级 LLM4Rec / agentic shopping 论文,把语义 ID、商品检索、排序、搭配和多轮状态管理统一进模型原生的 item-space fulfillment。
325Netflix · GenPageGenPage: Towards End-to-End Generative Homepage Construction at Netflix少见的 Netflix 生产系统论文,直接把传统多阶段首页推荐改写为单 transformer 自回归生成多行结构化首页,并报告线上 A/B 与延迟结果。
326特拉维夫大学 · MonoRecMonosemanticity in Recommender Systems把 mechanistic interpretability 的 SAE/monosemantic feature 思路迁移到推荐 embedding,可用于解释、调试和偏置干预;图表丰富,适合做深度笔记。
327中科院 · NPMNeural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering把 agent memory 从显式文本规则推进到 activation-space procedural steering,能和推荐系统中的长期用户行为/策略记忆形成类比。
328港中文 · VISTALLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via a Proprioceptive Dashboard长程工具 agent 的上下文管理问题和推荐系统里的状态窗口/记忆淘汰高度相似;论文提出训练免费的可见内部状态界面并给出多 benchmark 增益。
329UBC · SeKVSeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference从系统角度解决长上下文 LLM 的 KV cache 内存瓶颈,和 agent/RAG/推荐长序列服务的成本约束直接相关。
330快手 · IID-NavFrom Extraction to Navigation: Progressive Retrieval with Indirectly Infinite Depth快手工业召回论文,把 retrieval 从静态 i2i extraction 改成带状态的目标导向 graph navigation,并给出 QPS/Recall 与线上 A/B 结果。
331缅因大学 · ColdStart RetrievalDiagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation拆开 LLM reranker 与 retrieval coverage,证明冷启动推荐的主要瓶颈常在候选池覆盖,而不是提示词或模型规模。
332快手 · POEMPOEM: Partial-Order Enhanced Real-Time Sequential Modeling for Recommendation用上游多任务排序分构造动态 partial-order sequence,处理实时兴趣漂移,并在快手线上推荐链路验证。
333新加坡国立 · WorldEvolverSelf-Evolving World Models for LLM Agent Planning让 frozen world model 在测试时通过 episodic/semantic memory 自修正,为长程 LLM agent planning 提供可过滤的 foresight。
334上海AI实验室 · Agents-A1Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent35B MoE agent 通过扩展长程轨迹和多教师 domain-routed on-policy distillation,逼近超大模型 agent 表现。
335缅因大学 · KnowBeforeFetchKnow Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation把固定 top-k RAG 改成校准检索预算分配,在 k=0/k=1/k=5/abstain 之间显式权衡准确率、token 和延迟。
336快手 · GLANFrom Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling快手工业个性化入口导航论文,把 CQL 式 RL 改成 Decision Transformer 序列建模,并给出 DAU/LT 在线增益,直接服务推荐与产品入口决策。
337多校 · IntuRecIntuition-Guided Latent Reasoning for LLM-Based RecommendationLLM4Rec 交叉方向,核心不是让 LLM 直接生成解释,而是用候选集作为 preference-aligned intuition embedding 约束潜空间推理起点。
338多校 · PermRFast and Feasible: Permutation-based Constrained Reranking for Revenue Maximization它把电商/搜索重排里的收入目标、相关性约束、欺诈风险和线上延迟放进同一个 ILP/近似算法框架,并有 56M 查询 A/B 结果。
339多校 · L2AEnd-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference推理资源动态变化是线上 LLM/RAG/Agent 系统的真实约束;L2A 同时建模输入难度与运行预算,覆盖层跳过、head pruning 和推理 token 缩减。
340京东 · Oxygen AIICJD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications大规模电商商品理解系统论文,连接 LLM/VLM、商品知识、搜索、推荐和运营,覆盖数百亿 SKU 级资产和线上业务指标。
341清华 · SHIFTSHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented GenerationRAG 系统经常面对检索上下文与参数知识冲突;SHIFT 用少量门控参数调制内部表示,避免直接编辑 neuron 带来的级联副作用。
342多校 · NOVANOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems推荐系统和 LLM agent 的强交叉:它把代码生成、架构搜索、离线验证、在线 A/B 和失败记忆放进同一个工业推荐迭代闭环,对用户关注的推荐工程自动化最直接。
343多校 · TRUSTTRUST: Item-Calibrated Interval Evidence for Temporal Session-Based Recommendation这是今日推荐算法配额中最干净的机制型论文:问题小而明确,直接挑战时间间隔绝对值建模假设,并给出可插拔的校准信号,适合沉淀为会话推荐与用户行为节奏建模笔记。
344快手 · UniFormerUniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation与 NOVA 的自动架构演进互补:UniFormer 是具体推荐模型扩展方案,能展示工业推荐从行为建模、特征交互、任务空间到请求级推理加速的系统设计。
345哈工大 · SocialPersonaSocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context它把个性化 LLM、用户长期记忆和推荐画像连接起来,且提供可评测 benchmark;对用户建模、内容理解、个性化 RAG 与推荐中的 revealed preference 都有迁移价值。
346独立研究 · CARVECARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear AttentionLLM 长上下文效率仍是推荐/RAG/Agent 系统的底层瓶颈;CARVE 的 key-axis erase 和块并行求解把记忆更新、吞吐、参数效率放在同一个理论框架里,值得作为底层模型方向追踪。
347多校 · ProvenAIProvenAI: Provenance-Native Traces of Evidence in Generated AnswersRAG 的可解释性正在从“有没有引用”走向“引用是否支撑、检索文档是否真的影响答案”;这对搜索、推荐解释、企业知识库和 Agent 审计都很关键。
348未在 arXiv 摘要页完全核验;目录暂用多校 · S2-CARS2-CAR: Segmentation-Supervised Complexity-Adaptive Recommendation它针对序列推荐中真实兴趣边界不可见、固定窗口错分段、短期信号过度依赖三个问题,给出了可插入现有 backbone 的分段监督模块,适合今天推荐算法配额。
349未在 arXiv 摘要页完全核验;作者包含 Xu Chen、Zhenhua Dong、Huifeng Guo 团队 · AdaptSimTowards Fast Domain Adaptation and Fine-Grained User Simulation for Evaluating Conversational Recommender Systems它把 LLM 用户模拟器从固定 prompt 评估推进到可迁移、可控、可细粒度比较的 CRS 评估框架,和推荐系统评测、用户建模以及 LLM4Rec 交叉度高。
350未在 arXiv 摘要页完全核验;目录暂用多校 · TBRS-ControlTrajectory-Based Recommender Systems as Control Systems它不是单个模型 benchmark,而是把长期目标推荐、轨迹、状态和控制目标统一起来,适合作为推荐长期价值优化和平台策略建模的理论线索。
351未在 arXiv 摘要页完全核验;目录暂用多校 · ProgressAdvantageNeglected Free Lunch from Post-training: Progress Advantage for LLM Agents它把 Agent 过程奖励从额外标注/训练转成后训练副产品,对长链工具调用、在线推荐 Agent 的失败归因和测试时扩展都有直接迁移价值。
352未在 arXiv 摘要页完全核验;作者包含 Stanford/UC Berkeley 相关研究者 · SPIRALSPIRAL: Learning to Search and Aggregate它直接对齐测试时扩展的三类 compute primitive,能解释为什么简单 majority vote 之外还需要训练聚合器;对推荐链路中的多候选推理和多策略重排也有借鉴价值。
353未在 arXiv 摘要页完全核验;目录暂用多校 · DustinDustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding它把长上下文服务中的 speculative decoding 验证瓶颈拆成 KV 加载和 token 选择问题,对 RAG、Agent 长会话和推荐解释生成的推理成本控制都有工程价值。
354Walmart / 多作者团队 · AutoRelAnnotatorAutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search与 6 月 24 日 Walmart dense retrieval 论文形成上下游关系:前者讲训练数据,本文讲离线标注与评估基础设施,能补齐搜索广告召回/排序系统中标签质量治理这一环。
355Kuaishou / 多作者团队 · RaGRecommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale它把推荐从匹配已有内容推进到按兴趣生成内容,直接触及短视频/广告推荐的供给侧闭环,是今日推荐算法候选中工业系统意味最强的一篇。
356Google / YouTube / 多作者团队 · TokenMindsTokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems它把近期大量 Semantic ID/item token 工作推进到用户侧,直接服务长期用户理解、跨场景建模和工业异步表征生成。
357多校 / 机构待 PDF 核验 · ToolBench-XBeyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability推荐系统和数据平台越来越多地把 LLM agent 接入工具链,本文把工具失效恢复从 anecdote 变成可测 benchmark。
358Chinese Academy of Sciences / 多作者团队 · ToolRLCollapseWhy Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It与 ToolBench-X 形成训练/评测互补:一个解释 tool-use RL 为什么会坏,一个评估工具环境坏了时 agent 是否能恢复。
359多校 / 机构待 PDF 核验 · GraphRAGNeededIs GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization它给 RAG/GraphRAG/Agentic RAG 的工程选型提供反例意识:高级检索不是越复杂越好,关键在场景和上下文预算。
360Zhejiang University · BEARBEAR: Towards Beam-Search-Aware Optimization for Recommendation with Large Language Models把 LLM 推荐中的 SFT 目标与 beam search 推理对齐,用 token-level top-B 必要条件降低正样本被过早剪枝的风险。
361多校 / OpenThoughts 团队 · OpenThoughts-AgentOpenThoughts-Agent: Data Recipes for Agentic Models把 Agentic 模型的数据工程从“多跑轨迹”拆成可复用的任务、轨迹、裁判和反思配方,适合跟踪工具调用和训练数据闭环。
362Tsinghua University / 多机构合作 · AgentNativeMemoryAre We Ready For An Agent-Native Memory System?把 memory 从 RAG 外挂重新定义为 Agent 原生系统组件,覆盖写入、检索、更新、遗忘和安全边界。
363多校 / 机构未在摘要页完全核验 · GradDetectGrad Detect: Gradient-Based Hallucination Detection in LLMs用梯度信号定位幻觉风险,给 LLM 评估和安全过滤提供一种不只依赖输出文本打分的内部证据。
364多校 / 机构未在摘要页完全核验 · D2DDialogue to Discovery: Attribute-Aware Preference Elicitation for Conversational Product Search Assistants把对话商品搜索中的偏好澄清做成属性感知流程,强调何时问、问什么,以及如何把回答转成检索约束。
365Walmart / 多作者团队 · LLMAnnotatedRetrievalScaling Dense Retrieval with LLM-Annotated Training Data用 LLM 标注扩展 dense retrieval 训练数据,关注电商/搜索召回场景里弱标注扩容、质量控制和离线评估。
366多校 / Chen Ma 团队 · LLMJudgeTopKLLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation把 LLM-as-a-Judge 用于 Top-K 推荐离线评估,尝试补足纯点击指标对解释性、多样性和语义相关性的盲区。
367Shandong University · RecLoopDo Generative Recommenders Deepen the Information Cocoon? A Closed-Loop Simulation with LLM-powered User Simulators近期生成式推荐论文很多集中在精度或 Semantic ID 编码,这篇把闭环反馈、用户模拟和信息茧房放在一起,能提醒推荐系统不要只看下一物品命中率。
368KAIST / Snap Inc. · IIRGOn the Memorization Behavior of LLMs in Generative Recommendation: Observations, Implications, and Training Strategies它直接质疑 LLM4Rec 的核心假设:大模型带来的到底是语义泛化还是更强记忆。这个问题对线上推荐、长尾覆盖和评测切分都很关键。
369KAIST · SRPFNOne Sequential Recommendation Model Pretrained from Synthetic Priors Predicts Multiple Datasets它把推荐从“每个数据集训练一个模型”推向“用先验学会如何适配序列任务”,对冷启动域、快速类目上线和离线计算成本有启发。
370MIT / MIT-IBM Watson AI Lab · VariableWidthVariable-Width Transformers这类架构研究直接影响大模型服务成本:如果宽度可以按层重分配,推荐系统里的 LLM reranker、query rewriting 和多模态理解模块可能用更低 KV/cache 成本部署。
371NVIDIA · ZPPOZone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients它给后训练提供一个很工程化的折中:教师帮助学生构造可判别情境,但不直接污染 on-policy 梯度,对小模型、多模态和推荐侧轻量 ranker 蒸馏都有启发。
372Toyota Motor Europe / University of Trento · ELMContinual Self-Improvement with Lightweight Experiential Latent Memories它把 agent memory 从“文本片段缓存”推进到“可训练但很轻的潜表示”,对个性化助手、推荐解释记忆和长期用户画像更新都值得跟踪。
373多校作者 · DeepRubricDEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents把 deep research agent 的奖励从“事后让模型写 rubric”改成先构造证据树和原子评价目标,再反向合成 query-rubric 训练样本,直接解决研究报告奖励稀疏和评价口径漂移。
374多校作者 · TokenPilotTokenPilot: Cache-Efficient Context Management for LLM Agents把长会话 Agent 的 token 裁剪问题重新定义为“文本稀疏”和“prompt cache 连续性”的冲突,用 ingestion-aware compaction 和 lifecycle-aware eviction 保住前缀缓存。
375多校作者 · KVEraserKVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing针对长上下文里过时检索事实、错误工具观察或 prompt injection 需要事后删除的问题,用学习到的 steering states 局部替换被擦除 span 的 KV 状态,避免重算整段后缀。
376多校作者 · OneRankOneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation把工业推荐多目标排序里的 Transformer encoder 与 task head 解耦问题拆开,用 task-private channels 在 Transformer 内部做任务条件信息选择、候选感知上下文化和受控跨任务交互。
377多校作者 · ReaEmbHarmonizing Semantic and Collaborative in LLMs: Reasoning-based Embedding Generator for Sequential Recommendation面向序列推荐长尾问题,先用 latent reasoning-enhanced contrastive learning 激活 LLM 内部推理,再用 collaborative reward RL 显式对齐协同过滤信号。
378多校作者 · HoloRecHoloRec: Holistic Encoding and Interleaved Reasoning for Generative Recommendation把生成式推荐里的扁平语义表示和外部 CoT 标注问题合在一起解决,用多粒度嵌套残差量化构造层次语义编码矩阵,并在推理时交错生成 reasoning steps。
379Google · SemanticNativeLSMBeyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling用 RQ-VAE Semantic ID 替代长历史里的原子 Video ID,并用 temporal folding 与 global query 把短视频推荐扩展到 L=2000 级用户序列。
380Alibaba Group · AKT-RecFrom Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs用 MLLM/LLM 生成语义表示和 RQ-VAE Semantic ID,把头部 ID 的可靠知识非对称迁移到尾部用户/商品,同时用活动门控保护头部精排能力。
381多校作者 · AdaSRAdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization让模型边读流式输入边决定何时思考、何时等待,并用 Hierarchical Relative Policy Optimization 分开优化流式阶段和最终深思阶段。
382多校作者 · AgentSpecAgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition把感知、记忆、推理、反思、动作和学习模块标准化为可组合组件,用受控替换研究脚手架交互,而不是只比较单个模块强弱。
383Fudan University / Amazon · StreamMemBenchStreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance基于 EgoLife 第一人称生活流构造两步任务,区分证据写入、初始使用、反馈吸收和后续复用四个断点。
384多校作者 · ChronoIDChronoID: Infusing Explicit Temporal Signals into Semantic IDs for Generative Recommendation系统比较绝对/相对时间、早/晚融合、残差/平行量化,让同一 item 的离散标识携带交互节奏信息。
385University of Virginia / Snap Inc. · PauseRecImplicit Reasoning for Large Language Model-based Generative Recommendation指出 SID-based 生成式推荐里的显式 rationale 训练脆弱且昂贵,用可训练 <pause> token 做 latent computation。
386University of Technology Sydney / Australian Artificial Intelligence Institute · PADWhen Recommendation Denoising Meets Popularity Bias: Understanding and Mitigating Their Interaction证明小损失去噪在长尾正样本 loss 右移时会抬高有效头尾监督比,并用 popularity-aware gate 保护长尾真信号。
387多校作者 · OneRetrievalOneRetrieval: Unifying Multi-Branch E-commerce Retrieval with an Editable Generative Model用 Keyword-Aligned Encoding 把生成式检索和可小时级注入的新 term 编辑能力放进同一个电商召回模型。
388RedNote / Xiaohongshu · HelmsmanThe Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with Helmsman把推荐、搜索、广告中的大规模 ANNS 从高内存 HNSW 转向 all-flash 聚类索引,并用用户态存储栈和分层剪枝控制成本。
389多校作者 · CFALRCFALR: Collaborative Filtering-Augmented Large Language Model for Personalized Fashion Outfit Recommendation把 user-outfit 交互写成自然语言,同时用 CF-enhanced embeddings 把 LLM 语义空间接回个性化穿搭推荐。
390多校作者 · CQC-RAGCQC-RAG: Robust Retrieval-Augmented Generation via Cross-Query Consistency用语义等价查询、多证据视图和一致性置信缓解 RAG 对 query wording 与误导证据的敏感性。
391多校作者 · ReSumReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning把 RLVR 中的长推理 rollout 改造成可压缩、可分支评估、可强化学习的自总结过程,降低冗余和上下文漂移。
392多校作者 · ProReviewerFrom Passive Generation to Investigation: A Proactive Scientific Peer Review Agent把 LLM 审稿建模为带结构化 review log 的 MDP,让 agent 主动定位疑点、查证证据并更新审稿状态。
393多校作者 · APPOAPPO: Agentic Procedural Policy Optimization把 agentic RL 的分支点和 credit assignment 从工具调用边界下沉到序列内关键决策点。
394多校作者 · WorldReasonerWorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning用时间可得证据、概率预测、引用证据和因果事件图同时评估 agent 预测是否真有推理依据。
395Microsoft · HORMAOrganize then Retrieve: Hierarchical Memory Navigation for Efficient Agents把经验整理成文件系统式层级结构,再用轻量导航 agent 找到最小充分上下文。
396Delft University of Technology · RankGuardEfficient and Robust Online Learning to Rank in Decentralized Systems用本地私有点击历史校验外来模型更新,给去中心化 OLTR 加上抗投毒聚合门槛。
397Kuaishou · AIRAtomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations把 LLM 推理迁到离线原子意图构建,在线用检索与组合把语义能力接回毫秒级推荐链路。
398Princeton / Independent · tau-Rec$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems用可验证 reward 与 reveal-tagged elicitation 替代 LLM-as-judge,评估多轮推荐 Agent 的稳定推理能力。
399Shanghai Jiao Tong University / Xiaohongshu · DiffColdDiffCold: A Diffusion-based Generative Model for Cold-Start Item Recommendation用条件扩散从内容和近邻 warm item 生成冷启动表示,在不牺牲 warm item 表征的前提下缓解冷启动物品推荐。
400Google DeepMind / Google · UserPersonasLLM-Based User Personas for Recommendations at Scale把 LLM 生成的自然语言兴趣画像接入大规模视频推荐服务,用蒸馏、异步推理和语义聚类控制在线成本。
401The Chinese University of Hong Kong · GenAIRGenerative Archetype-Grounded Item Representations for Sequential Recommendation用 LLM 生成目标受众 archetype,再用行为校准目标让 item 表示同时保留语义和协同过滤结构。
402Samsung AI Center / Dartmouth · Doc2AtomDoc-to-Atom: Learning to Compile and Compose Memory Atoms把文档拆成语义类型化 knowledge atoms,每个 atom 编译成 micro-LoRA,并按 query 路由组合成专用 adapter。
403HKUST / NVIDIA · C-DICContext-Driven Incremental Compression for Multi-Turn Dialogue Generation用线程级可修订 dialogue memory 和 retrieve-revise-write-back 循环,让多轮对话压缩在数百轮后仍保持稳定延迟和困惑度。
404UCAS / CAS / Qwen Team · RACESVerifiable Environments Are LEGO Bricks: Recursive Composition for Reasoning Generalization把可验证环境按输入/输出类型递归拼接成复合任务,用环境组合而不是单题堆叠扩展 RL 推理训练信号。
405Sungkyunkwan University · FCRLLMFCRLLM: Aligning LLM with Collaborative Filtering for Long-tailed Sequential Recommendation用 FlipClass 双向 teacher-student 对齐,把冻结 LLM 语义嵌入和协同过滤序列表示结合起来,改善长尾用户与长尾物品推荐。
406City University of Hong Kong · IAMFrom Token to Item: Enhancing Large Language Models for Recommendation via Item-aware Attention Mechanism用 intra-item 与 inter-item 两类物品感知注意力,把 LLM 推荐从 token-centric 改造成 item-centric 协同建模。
407University of Technology Sydney · AgentSelectAgentSelect: Benchmark for Narrative Query-to-Agent Recommendation把 LLM leaderboard、工具评测和组合 Agent 合成监督统一成 query-to-agent recommendation 数据接口,服务长尾 Agent marketplace 中的能力匹配。
408Tencent AMS / Peking University · PRISMPRISM: Parallel Residual Iterative Sequence Model用输入锚定代理把多步残差迭代优化压缩成可并行 Rank-L 写入,在推荐序列建模中兼顾线性吞吐和接近显式 solver 的表达力。
409ByteDance / Bernini Team · BerniniBernini: Latent Semantic Planning for Video Diffusion用 MLLM 在 ViT embedding space 做目标语义规划,再由 DiT renderer 在 VAE latent space 渲染,统一视频生成、视频编辑和参考引导任务。
410多校作者 · BTRankingsBradley-Terry Rankings for Recommender Systems Across Dataset Taxonomies推荐/检索接口:它把推荐算法评测从简单平均 NDCG 推向带数据集条件的成对胜负建模,直接回应“模型在一个榜单上领先但换数据集失效”的选择风险。
411Yandex / 多校作者 · GBLAGated Bidirectional Linear Attention for Generative Retrieval推荐/检索接口:它把生成式推荐的长历史瓶颈落到 encoder 复杂度,给出可部署的线性双向注意力层,而不是只讨论 decoder 或 semantic ID。
412多校作者 · CaLIRBeyond Matching: Category-Guided Latent Intent Reasoning for Generative Retrieval in E-Commerce推荐/检索接口:它把电商 query 的类目先验放进潜变量推理过程,对“短 query 到 SID”的语义鸿沟给出低延迟方案,是生成式检索上线链路最需要的那类改造。
413Renmin University 等 · EmbedFilterYour UnEmbedding Matrix is Secretly a Feature Lens for Text EmbeddingsLLM 推理与表示:它把 LLM embedding 质量问题解释到 unembedding 矩阵和高频 token 子空间,给 RAG/召回中的向量退化提供了可诊断干预点。
414多校作者 · PUMFrom Correctness to Utility: Gain-Based Prefix Evaluation for LLM ReasoningLLM 推理与表示:它把过程监督从“这一句对不对”改成“这个前缀是否提高最终解题概率”,适合用于大规模推理搜索、RLVR 和稀疏奖励场景。
415Tsinghua University 等 · DyConDyCon: Dynamic Reasoning Control via Evolving Difficulty ModelingLLM 推理与表示:它把 overthinking 控制从静态难度分类改成逐步难度状态估计,可以直接接到推理预算调度、长链路 agent 和数学/代码任务服务。
416Kuaishou / OneRec Team · OneReasonOneReason Technical Report把 itemic token 感知、三段式推荐 CoT 和 specialize-then-unify RL 串起来,让生成式推荐的 thinking mode 在真实业务 benchmark 与线上部署中转化为收益。
417多校作者 · LatentFlowReasoningLatent Reasoning with Normalizing Flows用 Normalizing Flows 把显式 CoT 压到连续潜变量空间的潜式推理
418多校作者 · OPRDOPRD: On-Policy Representation Distillation把 on-policy distillation 从输出概率扩展到教师表示层的后训练蒸馏
419多校作者 · AgentSkillDiscoveryUnsupervised Skill Discovery for Agentic Data Analysis不用人工标签发现数据分析 Agent 可复用技能的无监督流程
420ACL ARR · CoExRecCoExRec: Collaborative Filtering-Grounded Large Language Model Based Sequential Recommendation and Explanation Generation用协同过滤证据约束 LLM 序列推荐解释生成
421韩国作者 · ACEACE: Anisotropy-Controllable Embedding for LLM-enhanced Sequential Recommendation控制 LLM 物品向量各向异性以稳定序列推荐微调
422Beihang University · XetrievalXetrieval: Mechanistically Explaining Dense Retrieval从 embedding 层解释稠密检索打分的机制化框架
423Kuaishou Technology · UxSIDUxSID: Semantic-Aware User Interests Modeling for Ultra-Long Sequence用 Semantic IDs 把超长用户行为压缩成 user-SID 级 target-aware memory,在离线生成与在线 KV 点查之间折中搜索式长序列建模和静态压缩。
424HKUST(GZ) / Alibaba / ZJU / HKUST · StreamMAStreaming Communication in Multi-Agent Reasoning把多智能体推理从完整回复传输改为逐步流式通信,用 reasoning-step pipeline 同时降低端到端等待并减轻后续错误步骤对下游 agent 的误导。
425National University of Singapore 等 · SEESelf-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data把开放式回答后的自评校准视作 latent ability elicitation,用少量样本、校准耦合 RL 与 masked distillation 诱导模型预测外部 judge 分数。
426Shanghai Jiao Tong University · Depth-AttentionDepth-Attention: Cross-Layer Value Mixing for Language Models把跨层选择放入 attention 模块内部,让当前层 query 沿深度读取浅层 key/value,保持标准 KV cache 形状并改善 Qwen-style decoder 表现。
427Renmin University / ByteDance / Meituan · DS-MLPDual-Stream MLP is All You Need for CTR Prediction用 teacher 显式交互蒸馏、并行隐式 MLP 和双重 alignment,把 CTR 复杂双流交叉结构压回更易部署的双 MLP。
428UC Berkeley · CarbonRerankTrading Engagement for Sustainability: Carbon-Aware Re-ranking for E-commerce Recommendations先用 Carbon Catalogue、语义检索、few-shot LLM 与近邻回退估计商品碳足迹,再用单参数后处理重排刻画 engagement 与 carbon 的 Pareto 取舍。
429Kuaishou Technology · RGCD-RepBridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning用教师 MLLM 生成短视频到直播的可迁移推理监督,蒸馏到轻量学生并分解 transferable/residual 表征,离线接入直播召回。
430Fudan University / Kuaishou · FlowTimeFlowTime: Towards Continuous Generative Watch Time Prediction via Flow-based Personalized Priors把观看时长预测从点回归和离散生成改写为连续生成式回归,用条件 normalizing flow 构造个性化 latent prior 以捕获用户/物品交互模式。
431Tsinghua University / Kuaishou · TaijiTaiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation把 LLM 作为工业推荐增强器,重点处理 CoT 质量评估和语义奖励/推荐奖励权衡。
432Fudan University · MARSMARS: Multi-rate Aggregation of Recency Signals for Sequential Recommendation across Sparse and Dense Regimes把真实时间戳和多尺度 recency 显式接入序列推荐,按稀疏/稠密场景选择 Transformer 或 Mamba。
433Pinterest · UniPinRecUniPinRec: Unifying Generative Retrieval and Ranking at Pinterest Scale把检索与排序从模型、训练到服务栈统一起来,用共享 Transformer 同时支撑 ANN 召回和 cross-attention 排序。
434UC San Diego · ACTSAgentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning把推理 token 预算控制改成 controller agent 的逐步决策,让冻结 reasoner 在不同预算下切换策略。
435Georgia Tech · QUBRICQUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards把开放式指令改写、rubric 生成和可学习性筛选联动起来,解决非可验证任务 RL 的奖励稀疏和 rubric 模糊问题。
436Northeastern University · HybridThinkerHybridThinker: Efficient Chain-of-Thought Reasoning via Compressed Memory and Transient Thought Steps在 CoT 压缩记忆和临时思考步骤之间折中,避免模型训练时绕开 memory token,降低推理成本。
437 Shanghai Jiao Tong University · BitLM BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion 把大词表 softmax 输出头改写成固定二进制码上的条件扩散去噪,用 block-causal backbone 和 diffusion head 原生支持多 token 联合生成。
438City University of Hong Kong / Kuaishou · GFN4RetentionModeling User Retention through Generative Flow Networks把用户留存视为 session 轨迹的终态奖励,用生成流网络和 refined detailed balance 把跨 session 留存归因到每一步推荐动作,同时保留点击、观看等即时反馈。
439Microsoft 等 · RHELMBeyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory用带人物设定、时间演化、文档和邮件等异构资料的长程交互,检验 full-context、RAG 与记忆框架在真实记忆任务上的短板。
440多校作者 · SaFeAUBeyond Instance-Level Alignment and Uniformity: Semantic Factor Learning for Collaborative Filtering用语义因子路由、匹配和语义正样本对齐缓解协同过滤中的伪负样本与图卷积高成本问题,让矩阵分解也能吸收高阶协同信号。
441University of Queensland 等 · FOSTERFOSTER: First-order Dataset Distillation for Text-based Sequential Recommendation把文本序列推荐的训练集压缩成少量合成序列,用随机 item 子集、一阶优化和语义共现正则降低带语言模型 item encoder 的蒸馏成本。
442WeChat, Tencent Inc. · LLM-WikiRetrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki把外部文档编译成可搜索、可沿链接阅读、可持续修复的 Wiki 知识结构,让检索成为 agent 推理动作而不是一次性 top-k lookup。
443UC San Diego / Microsoft Research · SchGenSchGen: PCB Schematic Generation with Semantic-Grounded Code Representations用语义扎根的 Python 编辑原语生成可编辑 PCB schematic,把自然语言硬件需求转成 KiCad 可继续检查和导出 netlist 的结构化代码。
444Beihang University 等 · KBFKBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing把模型在知识边界附近稳定答出的数值当作指纹,用 benign probes 审计 relay/API 是否把声明模型替换成其他后端。
445University of Catania 等 · RAGEARRAGEAR: Retrieval-Augmented Graph-Enhanced Academic Recommender面向高校课程推荐,先在课堂转录 chunk 中做语义检索,再用课程-课时-转录-片段知识图谱把细粒度证据传播成课程级排序。
446多机构作者 · ExplicitFeedbackRecToward User Preference Alignment in LLM Recommendation via Explicit Context Feedback强调推荐系统应把评论、critique、负反馈原因等自然语言显式上下文反馈转成可更新 memory、约束和评价信号。
447Shanghai Jiao Tong University · NCCEContexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering把自动 context engineering 改写成 instance-context 推荐问题,用 collaborative filtering 为每个输入选择最合适的上下文策略。
448Harbin Institute of Technology, Shenzhen · NaLaFormerNorm×Direction: Restoring the Missing Query Norm in Vision Linear Attention它指出线性注意力归一化会抵消 query norm,导致 softmax 中“query norm 控制 entropy”的动态温度缺失;NaLaFormer 用 norm-aware power 和 cosine direction 同时恢复尖锐性与方向信息。
449Harvard CMSA · Compression MathCompression is all you need: Modeling Mathematics它把人类数学定义的层级压缩力抽象成幺半群上的扩张函数,给出 A_n 对数密度 macro 的指数扩张定理,并在 MathLib 463k 节点上用 unwrapped、wrapped、depth 三列趋势检验 HM ≈ A_n log-density 假设。
450Zhejiang University · MemFTHow LoRA Remembers? A Parametric Memory Law for LLM Finetuning它把 LoRA 作为可控的参数记忆探针,给出损失下降、有效参数和序列长度之间的幂律关系,并用 token 级阈值解释精确记忆何时发生。
451Nankai University · CRITIC-R1CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation它不再让 critic 只给“答案对/错”的粗反馈,而是把 RAG 错误拆成 verdict、错误位置、推理分析和修复建议,并用分阶段奖励训练。
452Independent Researcher · Entity-CollisionEntity-Collision: A Stratified Protocol for Attributing Retrieval Lift in Agent Memory它把 agent memory 检索评测中的 lexical leakage 和 tag mixing 拆开,用所有 distractor 共享实体 token 的方式固定 BM25 下限,重新归因 dense embedder 的真实增益。
453City University of Hong Kong · UFRecLooking Farther with Confidence: Uncertainty-Guided Future Learning for Sequential Recommendation它把序列推荐中的 future supervision 从固定强度改成由当前预测置信度控制:模型确定时看得更远,不确定时回到 next-item 主任务。
454Pinterest, Inc. · AdsLLMFine-Tuned LLM as a Complementary Predictor Improving Ads System它避开“LLM 直接做在线 ranker”的重成本路线,让微调开源 LLM 预测可能 advertiser,再把预测作为候选生成和 ranking 的补充信号进入广告系统。
455Google / Google DeepMind · Gemini Embedding 2Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini用 Gemini 原生多模态能力统一文本、图像、视频、音频和文档 embedding,减少 ASR/caption/OCR 中间瓶颈,并在检索、多语言、代码和专业领域 benchmark 上展示强覆盖。
456Tsinghua University / Tencent · AsymRecAsymmetric Generative Recommendation via Multi-Expert Projection and Multi-Faceted Hierarchical QuantizationAsymRec 把生成式推荐中的输入表示和输出监督解耦:输入侧用多专家连续语义投影保留 item embedding 拓扑并缓解热门偏置,输出侧用多面分层量化构造高保真离散 Semantic ID,在四个 Amazon 数据集和线上 pCVR A/B 中验证收益。
457Carnegie Mellon University · STVSelf-Trained Verification for Training- and Test-Time Self-ImprovementSTV 把“带参考答案时更会发现错误”的不对称能力转成 verifier 训练信号,并把验证器反馈用于 test-time refinement 与 verifier-in-the-loop 训练,缓解推理模型自我改进中的反馈膨胀和坏样本回流。
458AMAP, Alibaba Group · GPlanGenerative Spatiotemporal Intent Sequence Recommendation via Implicit Reasoning in AmapGPlan 把地图场景里的下一步服务推荐改成时空可执行的意图序列生成,用 Progressive Implicit CoT Distillation 把显式推理压进 latent tokens,再用 Spatiotemporal Counterfactual DPO 对齐真实地理约束。
459Harvard University · BESSelf-Improving Language Models with Bidirectional Evolutionary SearchBES 把前向候选演化和后向目标分解合在同一套搜索框架里,用组合、突变、交叉、转位等演化算子扩大候选空间,再用可检查子目标给稀疏验证信号补充密集反馈。论文同时把这个机制用于 post-training 样本生成和推理时 test-time search,在多跳推理和开放问题求解上报告了相对 best-of-N、tree search 和开源推理框架更稳定的收益。
460Tsinghua University · SGSDSkill-Conditioned Gated Self-Distillation for LLM ReasoningSGSD 研究在没有参考答案或成功轨迹这类强 privileged information 时,能否从经验压缩出的 skill bank 中构造 on-policy self-distillation 信号。它把 retrieved skill-mistake pair 看成需要验证的 teacher hypothesis,而不是直接模仿的金标;多个 skill-conditi
461Zhejiang University · MemTraceMemTrace: Tracing and Attributing Errors in Large Language Model Memory SystemsMemTrace 把 LLM memory pipeline 转换成可执行的 memory evolution graph,并针对失败案例逐步追踪操作子图,定位信息丢失、检索错配、更新污染等根因。论文还构造 MemTraceBench,覆盖 Long-Context、RAG、Mem0、EverMemOS 等代表性记忆系统,并展示自动归因信号可反过来指导 prompt optim
462LUCID Inc. · AMRSAffective Music Recommendation: A Rollout-Based World Model for Offline Preference OptimizationAMRS 讨论的是一个在线实验受伦理约束的推荐场景:功能音乐推荐真正目标不是点击或完播,而是用户情绪状态的 valence/arousal 改善。系统用 causal transformer 世界模型预测 engagement、rating、valence、arousal,再把它作为 in-silico simulator 和 stress-testing 工具,用行为克隆初始
463The Hong Kong Polytechnic University · MixRAGRecMixture-of-Experts Knowledge Graph Retrieval-Augmented Generation for Multi-Agent LLM-based RecommendationMixRAGRec 针对 LLM 推荐中的 KG-RAG 粒度选择问题:简单 query 过度检索会引入噪声,复杂 query 检索不足又会缺失结构信息。它把系统拆成三个协作 agent:MoE retrieval agent 选择不同粒度的 KG expert,knowledge preference alignment agent 把图结构转成 LLM 友好的自然语言,co
464University of Otago · SIDTokenizerReliabilityHow Reliable Are Semantic-ID Tokenizer Comparisons in Generative Recommendation?这篇论文指出 SID-based generative recommendation 中常用的 SID-level top-K 评测隐含一个强假设:每个 SID 序列唯一映射到一个 item。作者在四个数据集、五类 tokenizer 上发现碰撞非常普遍,最高 30.5% item 参与碰撞,使 Hit@10 可被最高夸大 103.36%。他们提出 collision-awar
465USTC / Huawei · RSIRCan Recommender Systems Teach Themselves?用推荐模型自身生成用户交互序列,并以真实后续行为的 rank 作为 fidelity control,过滤偏离偏好流形的合成数据后递归训练后继模型。
466JD.com / HIT / PKU / CAS · SA2CRQTowards Efficient and Generalizable Retrieval: Adaptive Semantic Quantization and Residual Knowledge Transfer用路径熵自适应分配 semantic ID 码长,并用头部语义流形锚定尾部商品学习,缓解生成式检索里的头部撞码和尾部泛化不足。
467University of Maryland / CMU · LMSleepLanguage Models Need Sleep在上下文驱逐边界用多次离线 recurrent pass 巩固最近上下文,把信息写入 SSM fast weights,再清空 KV cache,探索长程推理中的“记忆形成计算”。
468Cambridge 等 · VeriTraceVeriTrace: Evolving Mental Models for Deep Research Agents把深度研究 Agent 的中间理解写成 cognitive graph,并用解释更新、偏差反馈和 schema 修订三个回路持续校准任务状态。
469Stanford 等 · ABAAutomated Benchmark Auditing for AI Agents and Large Language Models用 Agent 自动审计复杂 LLM/AI Agent benchmark,发现隐藏依赖、规格缺口和错误 ground truth,并量化问题任务对模型排名的扭曲。
470多机构合作 · Meta-Modal AgentMeta-Modal Agent: Sequential Evidence Routing for Missing-Modality Candidate Reranking把多模态推荐冷启动中的缺失文本、图像、图和用户历史证据视为序贯证据路由问题,用 LLM reranker 在候选池内选择可信证据。
471多机构合作 · LENSLENS: A Staged Design for Interaction Granularityin Sequential CTR Prediction在 latent-query sequential CTR backbone 上加入目标条件 query gate 与 position bias,恢复 target-specific control,并给出 item density 相关的 conditioning 规则。
472西班牙研究团队 · RankAidFirst, do no harm: Breaking suicidogenic echo chambers in media recommendation把媒体推荐中的心理健康安全写进重排目标,在用户脆弱状态下惩罚高风险内容、提升支持性内容,避免 engagement 优化放大有害回音室。
473BIT / Huawei / Peking University / CAS · Claw-AnythingClaw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World把 always-on personal assistant 放进多月事件流、多服务和多设备环境中,评估 agent 在广域数字世界里的上下文推理、跨服务行动和主动辅助能力。
474HKUST / Tsinghua Law / Waterloo · LegalSearch-R1Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning把本地法规 RAG、在线搜索和时间索引强化学习结合,减少法律 agent 把当前法规错误套用到过去案件的 temporal inconsistency。
475Alibaba Cloud Computing · DVAODVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning在多奖励 GRPO 后训练中按组内奖励方差动态组合 advantage,兼顾训练稳定性、目标协同和准确性/格式/长度等多目标 Pareto 权衡。
476Zhejiang University / Alibaba · DeGReDeGRe: Dense-supervised Generative Reranking for Recommendation用 Lookahead Evaluator 为生成式重排提供逐步稠密监督,缓解点击置顶启发标签偏差和 list-level sparse reward 的归因难题。
477Tencent / Xiamen University · SIRENSIREN: Unified Multi-Granularity Semantic Interaction for Multi-Modal Lifelong User Interest Modeling把相似度召回、Semantic ID grouping 和多粒度语义交互接入长期用户兴趣建模,缓解多模态空间与协同空间错配。
478Alibaba Group / USTC · QGSFrom Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark把搜索历史从 item-only 序列改写为 query-item pair token,并用 query-conditioned next-item objective 减少 query switch 带来的监督噪声。
479一作主机构未在 arXiv HTML 中清晰展开 · SkillOptSkillOpt: Executive Strategy for Self-Evolving Agent Skills把 agent skill 当作冻结 agent 的外部可训练状态,用优化器模型基于 scored rollouts 生成有界 add/delete/replace 文本编辑,并通过 held-out validation gate、textual learning-rate budget、rejected-edit buffer 和 epoch-wise slow/meta update 稳定训练。
480多机构作者 · MemAuditMemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection针对记忆增强 LLM agent 中通过普通交互写入恶意记忆的攻击面,提出事后审计框架,结合 counterfactual memory influence score 与 memory consistency graph,定位 harmful behavior 背后的高风险记忆。
481The Pennsylvania State University · Parallel Context CompactionParallel Context Compaction for Long-Horizon LLM Agent Serving把长程 agent 历史的一次性同步摘要改成分块并行压缩,让摘要体积、延迟和吞吐成为可预算的服务参数,降低主 agent 被摘要调用阻塞的风险。
482Tubi / Fox 相关团队 · TubiFMTubiFM: Unified Item, Carousel, and Search Ranking for Streaming Discovery将用户属性、会话、观看、surface、carousel context 和 search event 序列化为 user story,用 language tokens 与 domain event tokens 混合,把 item、carousel、search ranking 统一为 prompted next-token prediction。
483Microsoft AI India · HARNESS-LMHARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval用 billion-scale SLM teacher retriever 建立质量上界,再用 L2 query representation alignment 蒸馏到 sub-600M student encoder,最后做 contrastive refinement,目标是在赞助搜索中同时保留检索质量和线上低延迟。
484Netflix Research · Netflix Generative RecommendersTowards Generalizable and Efficient Large-Scale Generative Recommenders把用户行为作为事件序列,研究 Netflix production-scale title recommendation 中 2M 到 1B backbone 的 task-dependent scaling,并围绕训练效率、serving latency 和新 title 泛化提出 multi-token prediction、sampled softmax、projected decoding head、semantic item towers 与 collaborative-embedding masking。
485UIUC / Meta AI / UIC · InterFormerInterFormer: Effective Heterogeneous Interaction Learning for Click-Through Rate Prediction用 Interaction Arch、Sequence Arch 和 Cross Arch 让非序列特征与行为序列在 CTR 模型中双向交换信息。
486TikTok / ByteDance · PEARLPEARL: Unbiased Percentile Estimation via Contrastive Learning for Industrial-Scale Livestream Recommendation用用户级历史对比池把 watch time、消费、互动等反馈转成用户内百分位,缓解高活跃用户支配训练的直播推荐偏差。
487Meta AI · WukongWukong: Towards a Scaling Law for Large-Scale Recommendation用 stacked factorization machines 和 dense scaling 策略,让推荐系统交互模块在百 GFLOP/example 级别仍保持稳定质量提升。
488Meta Platforms, Inc. / OpenAI · KunlunKunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design用 GDPA、HSP、CompSkip 和事件级个性化重构异构特征 CTR 架构,把推荐系统扩模问题从“更大模型”推进到可测量的 scaling efficiency。
489Kyutai · KairosUnderstanding Data Temporality Impact on Large Language Models Pre-training用 KairosQA 和 6B 预训练对照实验量化 Common Crawl 时间顺序、知识新鲜度与模型能力之间的关系。
490RPI / IBM Research · LCGuardLCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems在多智能体系统中允许共享有用 KV 表征,同时用潜通信 guard 降低隐私重构和敏感信息泄漏风险。
491上海交通大学 / 华为 · DeltaBoxDeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback用 DeltaState、DeltaFS 和 DeltaCR 把 agent 沙箱的状态保存与回滚降到毫秒级,支撑并行搜索、分支试错和安全恢复。
492SK Telecom / KAIST · ABPODon't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target在持续 LLM 推荐更新中把曝光偏差和反馈歧义显式纳入偏好优化,避免模型被线上 bandit feedback 牵引到错误方向。
493清华大学 / 京东 · TGQ-FormerText-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation用文本 query 引导商品视觉表征,并通过 reliability-aware dual-gated modulation 缓解电商图像噪声和模态错配。
494美团 · GenLIGenerative Long-term User Interest Modeling for Click-Through Rate Prediction用 IGM、BRM 和 IFM 生成并融合长期兴趣表征,提升 CTR 模型对长序列、稀疏行为和兴趣迁移的建模能力。
495Airbnb · Natural Language SearchBridging the Cold-Start Gap: LLM-Powered Synthetic Data Generation for Natural Language Search at Airbnb用 seed-guided contrastive generation 解决自然语言搜索冷启动训练和评估样本不足。
496Nanyang Technological University · GCRSGenerative Conversational Recommender System把对话推荐统一成 intent、semantic ID target 和 response 的结构化自回归生成。
497Shandong University · ThinkGRIntegrating Chain-of-Thought into Generative Retrieval: A Preliminary Study在生成式检索中交替生成 thought 和 docid,用 hybrid decoding 支持多跳检索。
498MIT / Sakana AI · VPOVector Policy Optimization: Training for Diversity Improves Test-Time Search把 RL 后训练从单标量最优改为覆盖 reward vector 的多样候选集合,服务 best@k/search。
499NVIDIA · Gated DeltaNet-2Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention在线性注意力中分离 erase gate 与 write gate,改善固定状态长上下文记忆编辑。
500USTC / HKUST / HKBU · MOSSMOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems把 self-evolving agent 的修改范围推进到源码层,并用 trial replay、verdict 和 rollback 约束。
501University of the Chinese Academy of Sciences · BRIDGE / BGCCBehavior-Guided Candidate Calibration for Multimodal Recommendation它不是继续把视觉/文本特征做得更强,而是问“内容证据什么时候该进入最终候选排序”。这个问题非常贴近多模态推荐线上链路:粗排候选空间可以保持稳定,最后几百或几十个候选才用行为证据做残差校准。
502City University of Hong Kong · RPORecReinforced Preference Optimization for Reasoning-Augmented Recommendations它把 LLM 的显式推理接入推荐任务,但没有停留在“让模型生成理由”。RPORec 用推荐头给 reasoning 提供任务反馈,并报告了工业广告系统的 nearline/online 部署形态,适合作为 LLM4Rec 从论文走向链路的样
503Meta Platforms, Inc. · LLM Ad RetrievalLLM Retrieval for Stable and Predictable Ad Recommendations它把广告推荐的评价从单纯 Recall/NDCG 扩展到 stability 与 predictability,并把 LLM 生成的广告语义属性用于候选生成。对广告系统来说,稳定性本身就是产品体验和投放可信度指标。
504论文首页未清晰列出统一机构 · Search-E1Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning它针对搜索增强推理训练中的“复杂组件堆叠”做减法:只用 vanilla GRPO 和 offline self-distillation,让 agent 从自己的 sibling rollout 中学习更有效搜索路径。对 RAG/搜索 Ag
505State Key Lab of CAD&CG, Zhejiang University · DeferMemDeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA它把长期记忆系统的关键动作推迟到 query-time:先高召回取候选,再按具体问题蒸馏成自包含证据。对 Agent 长期记忆、个性化 RAG 和推荐用户画像压缩都非常相关。
506论文首页列出 1/2 编号机构,但公开文本片段未完整展开 · ArborKVArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning它针对 Tree-of-Thought 等搜索式推理的实际瓶颈:分支、回溯和 frontier 会让 KV cache 急剧膨胀。ArborKV 从搜索树结构出发做 cache eviction 和 lazy rehydration,对测试
507 技术脉络 · MQL4GRec / MACRec / SynGR 从 MQL4GRec 到 MACRec 再到 SynGR:多模态生成式推荐的技术演化与工程取舍 把统一量化语言、跨模态量化对齐和协同语义串成一条线,并讨论双 SID、多任务训练与双路推理的成本收益比。
508 ServiceNow / Mila / UdeM · Mem-π Mem-π: Adaptive Memory through Learning When and What to Generate 把长期记忆从相似度检索改成会 abstain、会生成当前指导的 memory policy。
509 Boston University / Harvard · PALS PALS: Power-Aware LLM Serving for Mixture-of-Experts Models 把 GPU power cap 和 batch size 联合纳入 vLLM 运行时控制,在 MoE serving 中提升能效并降低 QoS violation。
510 Stanford · Agent JIT Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling 把网页 Agent 任务即时编译成可执行代码计划,并用协议约束和调度器减少逐步 CUA 的模型往返。
511 Amazon AGI / AWS · LTC Layer-wise Token Compression for Efficient Document Reranking 把 token 压缩放到 cross-encoder 中间层,在保留 query-document 交互后降低重排推理成本。
512 人大 / 山大 / 北大 · MDCNS Divergence Meets Consensus: A Multi-Source Negative Sampling Framework for Sequential Recommendation 用 Teacher-Peer-Self 多源分歧与共识蒸馏改进序列推荐 hard negative sampling。
513 人大 / Ant International · DelTA DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards 从判别式 token-gradient 视角重分配 RLVR 信用,让高奖励和低奖励响应的关键 token 更新更清晰。
514 ICML 2026 · 推荐/广告/LLM4Rec 汇总 ICML 2026 推荐、广告与 LLM4Rec 筛选论文汇总 核验 35 篇 ICML 2026 相关论文,跳过已有完整笔记的重复项,按广告机制、生成式推荐、图推荐、RAG/Agent 和可靠推荐整理工程导读。
515 东北大学 / 中山大学深圳校区 · CausalDPO Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation 把后门调整、软聚类伪环境和 MMD 不变性正则接入 DPO,缓解生成式推荐在分布偏移下放大环境混杂的问题。
516 Virginia Tech 等 · HypRQ-VAE HypRQ-VAE: Long-Tail-Aware Item Indexing for Generative Recommender Systems 把 RQ-VAE 的残差量化迁移到双曲空间,为生成式推荐构造更长尾友好的 semantic ID。
517 北京航空航天大学 · SynGR SynGR: Unleashing the Potential of Cross-Modal Synergy for Generative Recommendation 用显著性遮蔽和协同对比学习打断单模态捷径,让多模态生成式推荐真正利用视觉与文本的联合语义。
518 北航 / 美团 · MACRec Multi-Aspect Cross-modal Quantization for Generative Recommendation 把跨模态对比学习放进 RQ-VAE 残差量化,并用隐式/显式对齐增强多模态生成式推荐。
519 中山大学 / 鹏城实验室 · MQL4GRec Multimodal Quantitative Language for Generative Recommendation 把文本和图像 item 内容翻译成共享 quantitative language,通过 QLG 任务和预训练迁移推荐知识。
520 中国科学技术大学 · MemWeaver MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation 把用户文本交互历史组织成行为记忆和认知记忆,同时利用时间演化与语义关联来增强个性化生成。
521 UCF / Mobi.AI / Rice · TIDE TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload 利用扩散式 MoE 语言模型在同一 denoising block 内的专家激活稳定性,减少 GPU-CPU 专家迁移,做无训练、无损的推理加速。
522 浙江大学 / 阿里 Qwen · Graft Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding 把动态剪枝释放出的候选预算用于检索嫁接,用近乎零额外开销补回草稿树覆盖率,在短上下文和长上下文生成中提升投机解码速度。
523 北航等 · BalanceRAG BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation 把 LLM-only 与 RAG fallback 的两个不确定性阈值作为二维格点联合校准,在目标风险约束下尽量提高覆盖率并减少不必要检索。
524 MIT CSAIL / Stanford · PEEK PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents 在 agent prompt 中维护固定大小的 context map,缓存可复用的外部上下文定向知识,让长期反复访问同一语料或代码库的 Agent 更快、更便宜。
525 Microsoft / 厦门大学 / 上海交大 · m3BERT m3BERT: A Modern, Multi-lingual, Matryoshka Bidirectional Encoder 面向搜索和广告检索,把 embedding 维度与 transformer 层数都做成可裁剪的 Matryoshka 结构,并用 10B query-document 点击对做 Web 域预训练。
526 滴滴 / 港大 / 哈工大 / 香港理工 · D3-Subsidy D3-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market 用前缀条件扩散模型规划城市级未来轨迹,再通过逆动力学和拉格朗日对偶映射落到订单-司机补贴,线上 A/B 提升 Rides、GMV 和 DRV。
527 多校 · RAGR Review-Augmented Generative Recommendation 把评论语义放进生成式推荐序列,再用 DPO 避免 review token 抢走 item 预测目标。
528 快手 · DADF Distribution-Aware Debiasing Framework for Watch-Time Regression 在已有 watch-time predictor 后面接乘法残差修正器,专门处理局部校准偏差。
529 淘宝 · GrowthGR Multi-Value-Aware Retrieval Framework for E-Commerce Search 把新品长期增长价值显式接入 semantic-ID 生成式召回,服务电商搜索增长。
530 UNIST · EPIC Preference-Aligned Memory Construction for On-Device RAG 不再无差别保存原始资料,而是把端侧记忆压成偏好对齐的轻量 memory。
531 清华 / CMU / Lisbon · DashAttention Differentiable and Adaptive Sparse Hierarchical Attention 用 alpha-entmax 替代硬 top-k,让长上下文稀疏注意力按 query 自适应选块。
532 University of Virginia / Nokia · SAPO Step-Aligned Policy Optimization for Generative Recommendation 把 SID 的层级结构转成 RL credit assignment 的层级结构,缓解生成式推荐训练错位。
533 UCSD / Snap · Latte Expressiveness Limits of Autoregressive Semantic ID Generation 指出单棵 SID 解码树会耦合物品概率,并用 latent token 扩展表达力。
534 Generative Rec · CapsID Soft-Routed Variable-Length Semantic IDs for Generative Recommendation 用 capsule routing 做软路由,并通过 SEMANTICBPE 压缩相邻语义 token。
535 Microsoft MSN · Trinity Scenario-Aware Recommendation Framework for Large-Scale Cold-Start Users 面向新场景冷启动,把跨场景特征、模型更新准入和 COPC 校准串成系统方案。
536 华东师范大学 · VarLenRec Learning Variable-Length Tokenization for Generative Recommendation 让语义 ID 长度按商品流行度和语义复杂度自适应分配,缓解固定长度冲突。
537 阿里淘宝天猫 · RecGPT-Mobile On-Device LLMs for User Intent Understanding 端侧轻量 LLM 将用户最近行为压缩成 query/tags,再接入云端召回系统。
538 NeurIPS 2023 · TIGER Transformer Index for Generative Recommenders 生成式推荐的重要起点:把推荐问题改写成 semantic ID 的自回归生成。
540 NUS · LLM2Rec LLMs Are Powerful Embedding Models for Sequential Recommendation 探索如何让 LLM embedding 同时捕获协同过滤信号和文本语义。
541 KAIST · PerPEFT Personalized Parameter-Efficient Fine-Tuning of Foundation Models for Multimodal Recommendation 给每一群兴趣相近的用户单独训练一份 PEFT 模块,并用组内硬负样本让 CLIP 对同一件商品在不同人群眼中切换关注重点。