Real-SWE er en ny benchmark som tester hvordan KI-modeller presterer på private, virkelige kodebaser fra bedrifter. Målet er å gi et mer realistisk bilde av modellenes kodeferdigheter enn tradisjonelle tester.

Kilde: https://withspecific.com/benchmarks/real-swe