Una lente para leer a la máquina por dentro

Publicado 10 de agosto de 2026
Última modificación 10 de agosto de 2026

La semana pasada di una charla en la Jam interna de 540, a petición de @gorka e @isma, sobre esta investigación de Anthropic que he estado estudiando.

En julio Anthropic publicó un paper con un título estupendo, "Verbalizable Representations Form a Global Workspace in Language Models", y junto al paper algo menos habitual: la herramienta lista para usar con modelos abiertos. Así que me la bajé y me monté el laboratorio en interno, con modelos locales para poder usarlo.

La herramienta es la J-lens (Jacobian lens, lente jacobiana). Un modelo de lenguaje escribe token a token, pero entre que lee tu frase y suelta la primera palabra hay decenas de capas de cálculo que nadie ve. La lente traduce a palabras lo que pasa en cada capa y en cada token: una autopsia, a posteriori, de cómo ha operado el modelo con tu frase concreta. Eso, que hasta hace nada era terreno exclusivo de los laboratorios, ahora se puede hacer en local, con modelos de pesos abiertos, sin pedir permiso a nadie.

jlens_portada.png jlens_tranvia.png

La segunda imagen es la que más me interesa, porque es nuestra. Viene de un experimento previo que hicimos con el dilema del tranvía: treinta variantes de la misma pregunta, cambiando quién firma el consejo que recibe el modelo. Entonces solo podíamos mirar la respuesta final; ahora, con la lente, hemos repetido las variantes sobre modelos abiertos y hemos podido ver por dentro cómo se forma cada veredicto, capa a capa. El modelo cambia de opinión según quién firma el consejo, y desconfía especialmente cuando viene firmado por otra IA (aún en fase de hipótesis).

Lo segundo que me llevo es menos amable. Esto está recién abierto: el propio paper deja más preguntas que respuestas, y las empresas que ponen estos sistemas en producción tampoco saben del todo qué hay dentro. La interpretabilidad va años por detrás del despliegue. Los que usamos estos sistemas cada día somos una especie de beta testers de una tecnología que ni sus dueños parecen entender. Razón de más para tener herramientas propias con las que mirar dentro.

Y hay una derivada práctica. Montar modelos pequeños para propósitos específicos, un clasificador por ejemplo, va a ser cada vez más simple y barato para cualquier empresa. Ahí estas lentes pueden ser un elemento diferencial: saber qué está evaluando realmente el modelo para darte el resultado, y no quedarte solo con la salida.

De todo esto he preparado una charla con una presentación interactiva. Son temas complejos, y discutirlos entre varios facilita mucho la conversación; parte de la presentación son los datos reales de mis experimentos, a modo de validación. Si crees que encaja en tu espacio, colectivo o empresa, pídemela: la doy encantado.

Relacionados