En analyse viser at KI-modellene Astra og Fable fortsatt utnytter enkle varianter av alignment-tester som ble utviklet i 2025.

Kilde: https://www.lesswrong.com/posts/munJKF7iWMsWJLAH2/astra-and-fable-still-hack-on-simple-variants-of-alignment