Search-o1: Agentic Search-Enhanced Large Reasoning Models

Benchmark Model Rank Results
code-generation-on-livecodebenchSearch-o1#3Acc: 33
mathematical-reasoning-on-aime24Search-o1#3Acc: 56.7
on-gpqaSearch-o1#1Accuracy: 63.6
question-answering-on-natural-questionsSearch-o1#23EM: 34
question-answering-on-triviaqaSearch-o1#34F1: 74.1