CausalGym: Benchmarking causal interpretability methods on linguistic tasks

Benchmark Model Rank Results
interpretability-techniques-for-deep-learning-on-causalgymDAS#1Log odds-ratio (pythia-6.9b): 9.95
interpretability-techniques-for-deep-learning-on-causalgymLinear probe#2Log odds-ratio (pythia-6.9b): 3.42
interpretability-techniques-for-deep-learning-on-causalgymDifference-in-means#3Log odds-ratio (pythia-6.9b): 2.91
interpretability-techniques-for-deep-learning-on-causalgymk-means#4Log odds-ratio (pythia-6.9b): 1.87
interpretability-techniques-for-deep-learning-on-causalgymPCA#5Log odds-ratio (pythia-6.9b): 1.81
interpretability-techniques-for-deep-learning-on-causalgymLDA#6Log odds-ratio (pythia-6.9b): 0.27
interpretability-techniques-for-deep-learning-on-causalgymRandom#7Log odds-ratio (pythia-6.9b): 0.01