Resonnementscore for KI-modeller fortsetter å stige selv om beregningskraften per token synker kraftig. GLM-5.2 oppnår 99,2 % på AIME 2026 med rundt 40 milliarder aktive parametere per token, mens Qwen3.5 oppnår 91,3 % med bare 17 milliarder aktive.

Kilde: https://w4g1.dev/blog/models-are-getting-dumber-on-purpose