En bruker tester Qwen3.8s MTP-drafter med økt presisjon, men ytelsen falt fra 50,44 til 37,02 tokens per sekund – et eksempel på at mer presisjon ikke alltid gir bedre lokal inferens.
Kilde: https://piszczek.pl/blog/qwen38-27b-256k-50-tps-24gb-gpu
En bruker tester Qwen3.8s MTP-drafter med økt presisjon, men ytelsen falt fra 50,44 til 37,02 tokens per sekund – et eksempel på at mer presisjon ikke alltid gir bedre lokal inferens.
Kilde: https://piszczek.pl/blog/qwen38-27b-256k-50-tps-24gb-gpu