https://arxiv.org/abs/2602.08321
[2602.08321] Improving Data and Reward Design for Scientific Reasoning in Large Language Models
Abstract page for arXiv paper 2602.08321: Improving Data and Reward Design for Scientific Reasoning in Large Language Models