AI Can Learn Scientific Taste 是 OpenMOSS 团队(复旦等机构)47 页的长文,v3 版本今年 8 月中更新,近期重新进入讨论视野。论文研究的问题在 AI for Science 里非常根本:AI 科学家能检索文献、跑实验、写代码,但缺一种通常被称作「品味」的东西——判断哪个想法值得投入、哪个方向有长期潜力的直觉。这篇论文的答案是把品味变成可训练的能力。
什么是科学品味
论文开篇就给出定义:科学品味是判断和提出具有长期科学影响力(long-term scientific impact)的研究想法的能力。这种能力高度集中在少数资深研究者身上,而且通常只在几个专门领域内有效。
这个定义很工程友好,因为它把「品味」从玄学拉回到了可观测信号:一个研究想法的影响力,可以被社区反馈近似衡量,比如论文后续被引用的情况。有了可观测信号,就有了训练目标。
RLCF:把社区反馈变成奖励
论文的核心方法叫 RLCF(Reinforcement Learning from Community Feedback)。熟悉 RLHF 的开发者可以把它理解为奖励信号的更换。
RLHF 用人类标注员的即时偏好做奖励:两段输出哪段更好。这种信号获取快,但标注员看到的是一个片段,无法判断长期价值,容易被写作质量、表面完整性和迎合性带偏。模型会学会写得「像好研究」,而不是「做好研究」。
RLCF 的奖励来自社区聚合反馈,最典型的就是引用。一篇论文几年后被引用的规模,是社区对它长期价值的投票。用这种信号训练,模型被迫学习「什么样的想法真的有后续」,而不是「什么样的想法看起来好」。
代价也明显:引用信号滞后数年、分布随领域和年份漂移、存在马太效应——知名作者的论文天然获得更多引用。论文需要在训练设计里处理这些偏差,这也是它篇幅达到 47 页的原因之一。
Scientific Judge:学习判断
第一个产物是 Scientific Judge。给定一篇论文,它学习预测这篇论文的长期影响力。训练数据是历史论文加上它们的社区反馈轨迹。
评测结果里最有信息量的是泛化性三连:Judge 的判断力迁移到了未来年份的论文(用 2026 年前的信号训练,预测训练截止之后的论文表现)、迁移到其他社区指标(不只是引用,还有其他聚合反馈)、迁移到训练时未见过的领域。这说明它学到的是某种关于「好研究长什么样」的可迁移特征,而不是背下了训练集的引用记录。
这一点对「AI 学会品味」的命题很关键。如果只是记忆,换个年份或领域就失效;泛化成立,才谈得上品味。
Scientific Thinker:学习提出想法
第二个产物是 Scientific Thinker。它的任务形态很直接:给定一篇论文的标题和摘要,提出一个具有高潜在影响力的后续研究想法。论文使用的 prompt 大意是「你是一位 AI 研究者,基于以下论文提出有高潜在影响力的后续想法」。
评测用集成评估(ensemble evaluation):多个评估视角对 Thinker 提出的想法和基线模型的想法打分比较。结果显示 Thinker 的想法在潜在影响力上胜过基线。领域内的 win rate 明显,跨领域也有提升。
值得注意的是这条路线和「用 LLM 刷论文数量」是两回事。目标函数是想法的长期潜力,这天然反直觉地奖励深挖而不是广撒——至少在奖励建模正确的前提下。
工程意义:从品味到选题系统
对开发者,这篇论文的启发不在复现训练,而在三个可以马上借鉴的设计。
第一,文献综述的排序可以换目标。现在多数工具按相关度或新鲜度排序,RLCF 的思路是按「这篇工作对未来研究的启发潜力」排序。哪怕不训练模型,用历史引用轨迹做特征也能起步。
第二,Idea 生成器要有反馈闭环。Thinker 的价值来自奖励信号的质量,而不是 prompt 写得多好。团队做内部创新工具时,最该花力气的是积累「哪个想法后来真的有用」的追踪数据,哪怕只是人工季度回顾。
第三,评估要用时间外样本。Judge 的泛化性评测(未来年份、未见领域)是个可直接搬走的评测设计:任何声称「学会了判断」的系统,都要在训练截止时间之后的数据上验证,否则学到的可能只是记忆。
风险与边界
论文标题是「AI 能学会科学品味」,读的时候要警惕几个边界。
引用是偏差很大的代理指标。领域引用密度差异巨大,工具型论文天然高引,理论突破可能沉寂十年。用引用训练的品味,会系统性地偏向「容易被跟进的工作」。这一点论文自己也在社区指标泛化评测里部分回应,但偏差无法根除。
品味也不等于正确。历史上有影响力的研究未必是好研究,负面的影响力同样真实存在。把「高影响」当「值得做」,是把描述性判断偷换成规范性建议。
最后是马太效应的自增强。如果资助机构和评审开始用这类 Judge 筛选想法,被模型偏爱的风格会获得更多资源,进一步扭曲引用分布,反馈回训练数据。品味的规模化自带这类循环风险,部署时需要保留人类刻意探索的预算。
结论
这篇论文把一个原本只属于资深研究者的黑箱能力——判断什么研究值得做——变成了明确的训练问题:用社区反馈做奖励,训练判断器和生成器,并在时间外样本上验证泛化。Judge 和 Thinker 的结果都支持「品味可学」这个命题。
对研究者,它提供了选题辅助的现实路径;对开发者,它是「长周期反馈信号如何进入训练」的完整案例研究。但引用代理的偏差和品味的规范性问题决定了:它是研究决策的支持系统,不是替代品。AI 有品味之后,人类研究者的责任不是变小了——判断什么时候该无视品味,反而是更稀缺的品味。