Cloudflare beskriver hvordan de har optimalisert kjøringen av språkmodellene Kimi og GLM på sin infrastruktur. Målet er lavere kostnader og bedre ytelse for AI-arbeidslaster i stor skala.
Kilde: https://blog.cloudflare.com/smaller-faster-safer-models/