Et nytt prosjekt viser hvordan den store språkmodellen Qwen 3.8 Flash Next på 125 milliarder parametere kan køres på forbrukermaskinvare som RTX 4090, med en hastighet på 100 tokens i sekundet.

Kilde: https://github.com/Niko1221/Strata