https://arxiv.org/abs/2604.11304
[2604.11304] BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
Abstract page for arXiv paper 2604.11304: BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
evaluating ai agents
https://arxiv.org/abs/2506.02548
[2506.02548] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
Abstract page for arXiv paper 2506.02548: CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
evaluating ai agents
https://wandb.ai/site/resources/events/evaluating-ai-agents-with-sambanova-and-wb-weave/
Evaluating AI agents with SambaNova and W&B Weave - Weights & Biases
evaluating ai agentsand wsambanova