Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Benchmark Model Rank Results
long-context-understanding-on-ada-levalVicuna-13b-v1.5-16k#41k: 53.42k: 29.24k: 13.16k: 4.38k: 2.212k: 1.416k: 0.9
long-context-understanding-on-ada-levalVicuna-7b-v1.5-16k#61k: 37.02k: 11.14k: 5.86k: 3.28k: 1.812k: 1.916k: 1.0
long-context-understanding-on-ada-levalLongChat-7b-v1.5-32k#71k: 32.42k: 10.74k: 5.76k: 3.18k: 1.912k: 1.616k: 0.8
long-context-understanding-on-ada-leval-tsortVicuna-13b-v1.5-16k#32k: 5.44k: 5.08k: 2.416k: 3.1
long-context-understanding-on-ada-leval-tsortLongChat-7b-v1.5-32k#42k: 5.34k: 5.08k: 3.116k: 2.5
long-context-understanding-on-ada-leval-tsortVicuna-7b-v1.5-16k#52k: 5.34k: 2.28k: 2.316k: 1.7