Et nytt prosjekt viser hvordan den store språkmodellen Qwen 3.8 Flash Next kan køres på en vanlig RTX 4090-GPU med en hastighet på rundt 100 tokens per sekund.

Kilde: https://github.com/Niko1221/Strata