La IA que se construye a sí misma - Anthropic
Anthropic explora cómo los sistemas de inteligencia artificial están acelerando su propio desarrollo. CORE-Bench evalúa la capacidad de los modelos para reproducir investigaciones existentes, mientras que METR mide su desempeño en tareas prolongadas. Los avances recientes muestran que modelos como Mythos Preview superan a humanos en decisiones clave, indicando un progreso significativo hacia la autonomía en la investigación. Estos resultados destacan el potencial de la IA para transformar su propio proceso de mejora y desarrollo.
Puntos Clave
- CORE-Bench prueba la capacidad de los modelos para replicar investigaciones existentes.
- METR evalúa el rendimiento de modelos en tareas de larga duración, como Mythos Preview trabajando 16 horas.
- Modelos avanzados como Opus 4.5 y Mythos Preview superan decisiones humanas en investigaciones complejas.
Fuente Original: Leer artículo completo en WEB
