Et nytt prosjekt gjør det mulig å køre den store språkmodellen Qwen 3.8 Flash Next med 125 milliarder parametere på forbruker-GPUen RTX 4090, med en hastighet på 100 tokens per sekund.
Et nytt prosjekt gjør det mulig å køre den store språkmodellen Qwen 3.8 Flash Next med 125 milliarder parametere på forbruker-GPUen RTX 4090, med en hastighet på 100 tokens per sekund.