跳到正文

#搜索

今日 0 条
9月16日周三
  1. Google Research31

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性要求。

12月9日周二