En utvikler har fått den enorme språkmodellen Kimi K3 på 2,8 billioner parametere til å kjøre med én token i sekundet på en MacBook Pro, ved å strømme modellvekter fra fire eksterne SSD-er. Prosjektet viser hvordan svært store modeller kan kjøres lokalt uten dedikert serverutstyr.

Kilde: https://github.com/argonautlabsai/deltafin