Et nytt prosjekt gjør det mulig å køre den store språkmodellen Qwen 3.8 Flash Next med 125 milliarder parametere på forbruker-GPUen RTX 4090, med en hastighet på 100 tokens per sekund.

Kilde: https://github.com/Niko1221/Strata