Robuta

https://arxiv.org/abs/2602.08321 [2602.08321] Improving Data and Reward Design for Scientific Reasoning in Large Language Models Abstract page for arXiv paper 2602.08321: Improving Data and Reward Design for Scientific Reasoning in Large Language Models