Artikkelen forklarer hvorfor MLA og MTP kolliderer i transformer-arkitekturer, ved å redusere attention-mekanismer til deres aritmetiske intensitet.

Kilde: https://changyi.fun/posts/attention-arithmetic-intensity/