heapsort
RESEARCH27

Open-World Evaluations for Measuring Frontier AI Capabilities

arXiv CS.AI·21. Mai 2026

Dieses Papier plädiert für „Open-World-Evaluierungen“ als Ergänzung zu traditionellen Benchmarks zur Messung von Grenz-KI-Fähigkeiten. Es stellt CRUX vor, ein Projekt zur Durchführung dieser regelmäßigen, langfristigen und realitätsnahen Aufgabenbewertungen, veranschaulicht durch einen KI-Agenten, der erfolgreich eine iOS-App veröffentlichte.

Original lesen