Et nytt prosjekt viser hvordan den store språkmodellen Qwen 3.8 Flash Next på 125 milliarder parametere kan kjøres på et vanlig RTX 4090-skjermkort med en hastighet på 100 token per sekund.
Et nytt prosjekt viser hvordan den store språkmodellen Qwen 3.8 Flash Next på 125 milliarder parametere kan kjøres på et vanlig RTX 4090-skjermkort med en hastighet på 100 token per sekund.