Et nytt open source-prosjekt gjør det mulig å kjøre den 125 milliarder parametre store språkmodellen Qwen 3.8 Flash Next på en vanlig RTX 4090-GPU med en hastighet på 100 tokens i sekundet.

Kilde: https://github.com/Niko1221/Strata