En gjennomgang av 30 modellkort fra ledende AI-laboratorier viser store forskjeller i hvilke benchmarker som rapporteres og hvordan. Forfatteren påpeker at oversikten sier mer om rapporteringspraksis enn om faktisk modellkvalitet.
Kilde: https://koutian.is-a.dev/benchmark-radar/?view=leaderboard