Et nytt prosjekt viser hvordan den 125 milliarder parametre store språkmodellen Qwen 3.8 Flash Next kan køres på et vanlig RTX 4090-kort med en hastighet på 100 tokens i sekundet.
Et nytt prosjekt viser hvordan den 125 milliarder parametre store språkmodellen Qwen 3.8 Flash Next kan køres på et vanlig RTX 4090-kort med en hastighet på 100 tokens i sekundet.