| language-modelling-on-big-bench-lite | GLM-130B (3-shot) | #1 | Accuracy: 15.11 |
| language-modelling-on-big-bench-lite | GLM-130B (1-shot) | #2 | Accuracy: 14.91 |
| language-modelling-on-big-bench-lite | GLM-130B (0-shot) | #3 | Accuracy: 13.31 |
| language-modelling-on-lambada | GLM-130B (bidirectional attention) | #7 | Accuracy: 80.2 |
| language-modelling-on-the-pile | GLM-130B | #5 | Bits per byte: 0.634 |
| language-modelling-on-the-pile | Jurassic-1 | #7 | Bits per byte: 0.65 |
| language-modelling-on-the-pile | GPT-3 | #16 | Bits per byte: 0.742 |
| long-context-understanding-on-ada-leval | ChatGLM3-6b-32k | #5 | 1k: 39.82k: 18.84k: 9.06k: 5.08k: 3.412k: 0.916k: 0.5 |
| long-context-understanding-on-ada-leval | ChatGLM2-6b-32k | #8 | 1k: 31.22k: 10.94k: 4.56k: 1.68k: 1.612k: 0.016k: 0.3 |
| long-context-understanding-on-ada-leval-tsort | ChatGLM3-6b-32k | #7 | 2k: 2.34k: 2.48k: 2.016k: 0.7 |
| long-context-understanding-on-ada-leval-tsort | ChatGLM2-6b-32k | #8 | 2k: 0.94k: 0.28k: 0.716k: 0.9 |
| multi-task-language-understanding-on-mmlu | GLM-130B | #23 | Average (%): 44.8 |