Robuta

https://arxiv.org/abs/2604.11304 [2604.11304] BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows Abstract page for arXiv paper 2604.11304: BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows evaluating ai agents https://arxiv.org/abs/2506.02548 [2506.02548] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale Abstract page for arXiv paper 2506.02548: CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale evaluating ai agents https://wandb.ai/site/resources/events/evaluating-ai-agents-with-sambanova-and-wb-weave/ Evaluating AI agents with SambaNova and W&B Weave - Weights & Biases evaluating ai agentsand wsambanova