La IA que se construye a sí misma - Anthropic
Anthropic ha desarrollado CORE-Bench, una herramienta que evalúa si los modelos de inteligencia artificial pueden reproducir investigaciones existentes, un paso esencial para realizar investigaciones originales. En solo 15 meses, los sistemas de IA pasaron de replicar resultados en un 20% de los casos a saturar el benchmark. Además, METR, que mide la capacidad de los modelos para completar tareas de larga duración, reveló que Claude Mythos Preview puede trabajar por al menos 16 horas, alcanzando el límite de las pruebas actuales.
Puntos Clave
- CORE-Bench evalúa la capacidad de los modelos de IA para replicar investigaciones científicas.
- Los sistemas de IA mejoraron significativamente en la reproducción de resultados en solo 15 meses.
- Claude Mythos Preview demostró trabajar por al menos 16 horas en tareas prolongadas.
Fuente Original: Leer artículo completo en WEB
