Benchmarking Llama2, Mistral, Gemma and GPT for Factuality, Toxicity, Bias and Propensity for Hallucinations

Benchmark Model Rank Results
bias-detection-on-rt-inod-biasGPT-4#1Best-of: 0.5
bias-detection-on-rt-inod-biasGemma#2Best-of: 0.41
bias-detection-on-rt-inod-biasBaseline#3Best-of: 0.41
bias-detection-on-rt-inod-biasMistral#4Best-of: 0.36
bias-detection-on-rt-inod-biasLlama2#5Best-of: 0.34
dialogue-safety-prediction-on-rt-inod-jailbreakingBaseline#1Best-of: 0.92
dialogue-safety-prediction-on-rt-inod-jailbreakingGPT-4#2Best-of: 0.91
dialogue-safety-prediction-on-rt-inod-jailbreakingGemma#3Best-of: 0.91
dialogue-safety-prediction-on-rt-inod-jailbreakingMistral#4Best-of: 0.87
dialogue-safety-prediction-on-rt-inod-jailbreakingLlama2#5Best-of: 0.86