Terminal-Bench-Science 0.1 tester AI-agenter på reelle arbeidsflyter hentet fra forskeres eget arbeid. Det er forskerne selv, ikke modellutviklere eller dataleverandører, som setter standarden for vitenskapelig kapasitet.

Kilde: https://www.terminal-bench-science.ai/announcement