Terminal-Bench-Science 0.1 tester AI-agenter på reelle arbeidsflyter hentet fra forskeres eget arbeid. Det er forskerne selv, ikke modellutviklere eller dataleverandører, som setter standarden for vitenskapelig kapasitet.
Terminal-Bench-Science 0.1 tester AI-agenter på reelle arbeidsflyter hentet fra forskeres eget arbeid. Det er forskerne selv, ikke modellutviklere eller dataleverandører, som setter standarden for vitenskapelig kapasitet.