Autoresearch: optimizar no es comprender

Publicado 12 de marzo de 2026
Última modificación 12 de marzo de 2026

Anoche dejé un ordenador investigando solo con Autoresearch

Bueno, no exactamente. Pero eso es lo que propone autoresearch, el nuevo proyecto de Andrej Karpathy.

El concepto: un agente IA recibe un setup real de entrenamiento de un modelo de lenguaje. Sin intervención humana, el agente modifica el código, entrena 5 minutos, evalúa si mejoró, y repite. Toda la noche. ~100 experimentos antes del desayuno.

El repositorio tiene solo 3 archivos que importan:
→ Uno fijo (datos y evaluación)
→ Uno que edita el agente (el modelo y el entrenamiento)
→ Uno que edita el humano (las instrucciones al agente)

El archivo que edita el humano es un Markdown. No es código. Es contexto: qué explorar, qué priorizar, qué restricciones respetar. Karpathy lo llama un "skill". Se podría llamar diseño de intención.

Es fascinante. El método científico automatizado: hipótesis, ejecución, evaluación, iteración. Un bucle que corre sin nosotros.

Pero precisamente por eso merece una segunda lectura.

Fijémonos en lo que estamos normalizando: delegar no solo la ejecución, sino el criterio sobre qué funciona y qué no. El agente decide qué hipótesis probar, qué resultado es mejor, qué camino seguir. El humano define el marco inicial y luego... se va a dormir.

Karpathy ya habla del siguiente paso: que esto sea masivamente colaborativo entre agentes, al estilo SETI@home. No un doctorando autónomo. Una comunidad entera de investigación artificial.

¿Y dónde queda entonces la comprensión?

Porque una cosa es que el modelo mejore y otra muy distinta es que entendamos por qué mejoró. Uno de los primeros usuarios que lo probó en un Mac Mini lo resumió bien: "26 de 35 experimentos fallaron, pero los 7 que funcionaron revelaron que el modelo mejoró simplificándose". Un hallazgo interesante. Pero lo descubrió el agente. El humano lo leyó en un log al día siguiente.

Optimizar no es comprender. Y la velocidad del bucle puede crear la ilusión de progreso sin que nadie entienda realmente qué está pasando dentro.

No digo que no sea valioso. Lo es, y mucho. Pero creo que la pregunta importante no es solo "¿cuántos experimentos puedo correr mientras duermo?" sino "¿qué capacidad de juicio estoy perdiendo cada vez que delego un ciclo más?"

El ordenador pasa de herramienta a laboratorio autónomo. Nuestro trabajo pasa de ejecutar a diseñar contextos.

Pero si no mantenemos la capacidad de cuestionar lo que el laboratorio produce, no estamos supervisando. Estamos confiando.

Y confiar no es lo mismo que entender.

Enlace: GitHub - karpathy/autoresearch (github.com)

Relacionados