Paper Reading

论文精读

按“机构 / 来源 - 模型名 - 一句话介绍”整理,减少截图和标签干扰,方便快速定位笔记。

Notes
541
Latest
2026-09-21
View
Text Index

541 篇

103Renmin University of China · TransRetrievalTransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial RecommendationTransRetrieval 是中国人民大学高瓴人工智能学院郑智飞等人与阿里巴巴淘天集团合作完成的工业推荐研究,已被 CIKM 2026 接收。论文讨论的不是排序阶段再堆一层更大的网络,而是怎样让 Transformer 真正进入亿级候选的召回阶段,并在严格时延下同时利用异构字段和多业务域数据。论文唯一入口为 arXiv:2608.25528;截至本轮核验,
106Renmin University of China · SPO++SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL这篇论文讨论长轨迹 Agent 强化学习怎样摆脱“同一提示必须凑齐一组 rollout 才更新”的等待瓶颈。作者为 Kai Ruan、Jinghao Lin、Qianshan Wei、Ziqi Zhou 与 Zihe Huang;第一作者来自中国人民大学高瓴人工智能学院,合作机构包括独立研究者、中国科学院自动化研究所、杜克大学和中国科学院计算技术研究所。论文
108Nara Institute of Science and Technology · UniSpecRecRethinking Semantic Alignment in LLM-Enhanced Collaborative Filtering: A Spectral Decoupling Approach这篇论文由奈良先端科学技术大学 Yedong Jin 等人完成,九州大学参与合作,研究对象是 LLM 语义表征如何进入通用协同过滤。作者没有再设计一个更复杂的“语义到行为”投影器,而是先追问对齐本身会留下什么、丢掉什么,再据此提出 UniSpecRec。论文于 2026 年 8 月 25 日公开在 arXiv:2608.24363;首页含 WSDM 2027
118University of Science and Technology of China · SSTRethinking Item Tokenization in Generative Recommenders: From Fixed Atoms to Semantic Subwords这篇 CIKM 2026 论文由中国科学技术大学团队主导,合作机构包括华为技术有限公司。论文研究生成式推荐中一个容易被“语义 ID 已经足够紧凑”掩盖的问题:同一套固定长度 SID 同时承担目标物品标识与用户历史表示,两种职责对 token 结构的要求其实并不相同。作者提出 Semantic Sub
127University of Washington · MidToolMidTool:面向 Agent 工具使用的中训练数据合成MidTool 研究的不是又一个工具调用后训练配方,而是一个更早的能力注入点:在通用预训练与 SFT/RL 后训练之间,用专门的工具使用语料做 mid-training。论文由华盛顿大学、Snowflake 与北卡罗来纳大学教堂山分校合作完成,一作 Fengqing Jiang 的主机构为华盛顿大学,其工作在 Snowflake 期间完成。论文于 2026-08-20 公开,入
128Xiamen University · SAPOSAPO:面向智能体强化学习的单轨迹自回归策略优化这篇论文由厦门大学梁大洋、刘云龙与南洋理工大学冯朗、安波合作完成,一作主机构为厦门大学。论文提出 Single-Rollout Autoregressive Policy Optimization(SAPO),目标是在一个因果语言模型里同时承载策略、状态值与动作值,从而保留 actor-critic 的时序信用分配,又不再维护独立的策略规模 critic。论文于 2026 年
129Korea University · SCoRDSCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based RecommendationSCoRD(语义辅助持续检索器—重排器蒸馏)研究轻量 ID 检索器高频更新、LLM 重排器低频更新时如何共同适应兴趣变化。作者为 Seunghyun Baek、Gyuseok Lee、Seunghan Lee、Wonbin Kweon、Dong Wang 与 SeongKu Kang;第一作者主机构是高丽大学,合作机构包括伊利诺伊大学厄巴纳-香槟分校与成均馆大学。PDF 标注
136University of Science and Technology of China · Think-to-PersonalizeThink-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval这篇论文研究本地生活电商搜索中的个性化召回:模型不再只把用户输入当成待编码的短字符串,而是结合购买历史,先生成一个表达潜在需求的 intent-enhanced query,再把它压入可做 ANN 检索的稠密向量。第一作者 Angqing Jiang 的主机构是中国科学技术大学,合作机构包括美团;论
459Harvard University · BESSelf-Improving Language Models with Bidirectional Evolutionary SearchBES 把前向候选演化和后向目标分解合在同一套搜索框架里,用组合、突变、交叉、转位等演化算子扩大候选空间,再用可检查子目标给稀疏验证信号补充密集反馈。论文同时把这个机制用于 post-training 样本生成和推理时 test-time search,在多跳推理和开放问题求解上报告了相对 best-of-N、tree search 和开源推理框架更稳定的收益。