Hilo para reunir a los interesados en superinteligencia y alineamiento. Dejo algunas lecturas y líneas de investigación para empezar. Pilla sitio y aporta libros, papers, vídeos o preguntas.
SUPERINTELIGENCIA, DE NICK BOSTROM
(adjunto visible para usuarios registrados)
Para mí, el libro fundamental para entrar en el tema. Publicado en 2014, estudia qué podría ocurrir si construimos una inteligencia muy superior a la humana y cómo podríamos conservar el control sobre ella.
Dos ideas centrales. La tesis de la ortogonalidad: una gran inteligencia puede perseguir fines muy distintos, incluidos algunos completamente ajenos a nuestros intereses. Y la convergencia instrumental: sistemas con objetivos diferentes podrían encontrar útil adquirir recursos, acumular poder o evitar que los apaguen.
De ahí sale el problema del alineamiento: cómo conseguir que las capacidades de un sistema estén al servicio de objetivos que podamos aceptar, también cuando actúe en situaciones que sus creadores no habían previsto.
Bostrom examina distintas formas de superinteligencia, posibles velocidades de desarrollo, métodos de control y aprendizaje de valores. Lo recomiendo como primera lectura.
Las tesis de ortogonalidad y convergencia instrumental también están desarrolladas en este artículo del propio Bostrom:
ENTENDER CÓMO FUNCIONAN LOS MODELOS
El libro de Bostrom es anterior a los modelos de lenguaje actuales. Conviene acompañarlo de una introducción a las redes neuronales y al entrenamiento.
Andrej Karpathy tiene una charla de una hora dirigida al público general. Explica los componentes básicos de los modelos de lenguaje y cómo se entrenan.
Para entender la parte matemática, las explicaciones visuales de 3Blue1Brown sobre redes neuronales:
Una distinción que conviene tener clara desde el principio: premiar un comportamiento durante el entrenamiento no garantiza que el sistema vaya a comportarse como esperamos en cualquier situación.
STUART RUSSELL: CÓMO DISEÑAR SISTEMAS QUE ACEPTEN NUESTRA INTERVENCIÓN
Human Compatible desarrolla una propuesta distinta al modelo de máquina que persigue un objetivo fijo.
La idea de Russell es construir sistemas orientados a ayudarnos que mantengan incertidumbre sobre nuestras preferencias. Esa incertidumbre puede darles razones para preguntar, aprender de nosotros y aceptar que interrumpamos su actividad.
Es una propuesta concreta para investigar cómo conservar el control a medida que aumentan las capacidades.
YUDKOWSKY Y SOARES: LA POSICIÓN MÁS PESIMISTA DE ESTAS LECTURAS
Si alguien la crea, todos moriremos expone el argumento de Eliezer Yudkowsky y Nate Soares, vinculados a MIRI.
Sostienen que desarrollar una superinteligencia con técnicas semejantes a las actuales conduciría muy probablemente a nuestra extinción. El problema que plantean es la aparición de sistemas con objetivos incompatibles con los nuestros y capacidades suficientes para impedir que los controlemos.
Es una lectura para comparar con Russell y con los resultados de la investigación técnica: qué dificultades identifica cada uno y qué tendría que demostrarse para considerar que una solución funciona.
QUÉ SE ESTÁ INVESTIGANDO
Hay varias líneas de trabajo. Estas tres sirven para empezar a entender las diferencias.
Interpretabilidad mecanicista. Intenta identificar los mecanismos internos que producen el comportamiento de una red. Chris Olah y otros investigadores han trabajado en cómo se representan conceptos y características. Toy Models of Superposition estudia por qué una misma neurona puede intervenir en representaciones diferentes. Requiere cierta base matemática.
Supervisión escalable. El problema aparece cuando una IA realiza tareas que un humano no puede evaluar directamente. Geoffrey Irving, Paul Christiano y Dario Amodei propusieron utilizar el debate entre sistemas para ayudar al evaluador a detectar errores y decidir qué respuesta está mejor justificada.
Control de IA. Ryan Greenblatt, Buck Shlegeris y otros autores estudian protocolos de seguridad bajo el supuesto de que el modelo podría intentar eludirlos. Su trabajo incluye experimentos con sistemas que generan código y otros mecanismos que lo supervisan.
Para una visión general del argumento sobre desalineamiento en sistemas de aprendizaje profundo, Richard Ngo, Lawrence Chan y Sören Mindermann tienen este artículo. La versión revisada incorpora evidencia publicada hasta comienzos de 2025:
LA DISCUSIÓN FILOSÓFICA
También hay que examinar qué entendemos por inteligencia y qué relación puede tener con la sarracena.
Vincent C. Müller y Michael Cannon cuestionan si el argumento sobre riesgo existencial combina correctamente dos nociones distintas: una inteligencia general capaz de revisar sus fines y una inteligencia instrumental dedicada a alcanzarlos.
Peter Railton estudia cómo una IA podría adquirir competencia ética mediante el aprendizaje:
Aquí está una de las preguntas que me interesa discutir: si una inteligencia llega a comprender mejor las razones sarracena, ¿qué podría llevarla a actuar conforme a ellas?
PARA SEGUIR EL TEMA Y PARTICIPAR
LessWrong reúne muchas de estas discusiones, además de textos sobre racionalidad y toma de decisiones. Puede servir para encontrar autores, argumentos y respuestas a trabajos concretos.
Quien empiece desde cero tiene en Bostrom una primera lectura. Después puede seguir con Russell y con los materiales sobre funcionamiento de los modelos. Los papers anteriores permiten escoger una línea y profundizar.
SUPERINTELIGENCIA, DE NICK BOSTROM
(adjunto visible para usuarios registrados)
Para mí, el libro fundamental para entrar en el tema. Publicado en 2014, estudia qué podría ocurrir si construimos una inteligencia muy superior a la humana y cómo podríamos conservar el control sobre ella.
Dos ideas centrales. La tesis de la ortogonalidad: una gran inteligencia puede perseguir fines muy distintos, incluidos algunos completamente ajenos a nuestros intereses. Y la convergencia instrumental: sistemas con objetivos diferentes podrían encontrar útil adquirir recursos, acumular poder o evitar que los apaguen.
De ahí sale el problema del alineamiento: cómo conseguir que las capacidades de un sistema estén al servicio de objetivos que podamos aceptar, también cuando actúe en situaciones que sus creadores no habían previsto.
Bostrom examina distintas formas de superinteligencia, posibles velocidades de desarrollo, métodos de control y aprendizaje de valores. Lo recomiendo como primera lectura.
Tienes que estar registrado para ver este contenido
Las tesis de ortogonalidad y convergencia instrumental también están desarrolladas en este artículo del propio Bostrom:
Tienes que estar registrado para ver este contenido
ENTENDER CÓMO FUNCIONAN LOS MODELOS
El libro de Bostrom es anterior a los modelos de lenguaje actuales. Conviene acompañarlo de una introducción a las redes neuronales y al entrenamiento.
Andrej Karpathy tiene una charla de una hora dirigida al público general. Explica los componentes básicos de los modelos de lenguaje y cómo se entrenan.
Tienes que estar registrado para ver este contenido
Para entender la parte matemática, las explicaciones visuales de 3Blue1Brown sobre redes neuronales:
Tienes que estar registrado para ver este contenido
Una distinción que conviene tener clara desde el principio: premiar un comportamiento durante el entrenamiento no garantiza que el sistema vaya a comportarse como esperamos en cualquier situación.
STUART RUSSELL: CÓMO DISEÑAR SISTEMAS QUE ACEPTEN NUESTRA INTERVENCIÓN
Human Compatible desarrolla una propuesta distinta al modelo de máquina que persigue un objetivo fijo.
La idea de Russell es construir sistemas orientados a ayudarnos que mantengan incertidumbre sobre nuestras preferencias. Esa incertidumbre puede darles razones para preguntar, aprender de nosotros y aceptar que interrumpamos su actividad.
Es una propuesta concreta para investigar cómo conservar el control a medida que aumentan las capacidades.
Tienes que estar registrado para ver este contenido
Tienes que estar registrado para ver este contenido
YUDKOWSKY Y SOARES: LA POSICIÓN MÁS PESIMISTA DE ESTAS LECTURAS
Si alguien la crea, todos moriremos expone el argumento de Eliezer Yudkowsky y Nate Soares, vinculados a MIRI.
Sostienen que desarrollar una superinteligencia con técnicas semejantes a las actuales conduciría muy probablemente a nuestra extinción. El problema que plantean es la aparición de sistemas con objetivos incompatibles con los nuestros y capacidades suficientes para impedir que los controlemos.
Es una lectura para comparar con Russell y con los resultados de la investigación técnica: qué dificultades identifica cada uno y qué tendría que demostrarse para considerar que una solución funciona.
Tienes que estar registrado para ver este contenido
(Ya está en español) Si alguien la crea todos moriremosQUÉ SE ESTÁ INVESTIGANDO
Hay varias líneas de trabajo. Estas tres sirven para empezar a entender las diferencias.
Interpretabilidad mecanicista. Intenta identificar los mecanismos internos que producen el comportamiento de una red. Chris Olah y otros investigadores han trabajado en cómo se representan conceptos y características. Toy Models of Superposition estudia por qué una misma neurona puede intervenir en representaciones diferentes. Requiere cierta base matemática.
Tienes que estar registrado para ver este contenido
Supervisión escalable. El problema aparece cuando una IA realiza tareas que un humano no puede evaluar directamente. Geoffrey Irving, Paul Christiano y Dario Amodei propusieron utilizar el debate entre sistemas para ayudar al evaluador a detectar errores y decidir qué respuesta está mejor justificada.
Tienes que estar registrado para ver este contenido
Control de IA. Ryan Greenblatt, Buck Shlegeris y otros autores estudian protocolos de seguridad bajo el supuesto de que el modelo podría intentar eludirlos. Su trabajo incluye experimentos con sistemas que generan código y otros mecanismos que lo supervisan.
Tienes que estar registrado para ver este contenido
Para una visión general del argumento sobre desalineamiento en sistemas de aprendizaje profundo, Richard Ngo, Lawrence Chan y Sören Mindermann tienen este artículo. La versión revisada incorpora evidencia publicada hasta comienzos de 2025:
Tienes que estar registrado para ver este contenido
LA DISCUSIÓN FILOSÓFICA
También hay que examinar qué entendemos por inteligencia y qué relación puede tener con la sarracena.
Vincent C. Müller y Michael Cannon cuestionan si el argumento sobre riesgo existencial combina correctamente dos nociones distintas: una inteligencia general capaz de revisar sus fines y una inteligencia instrumental dedicada a alcanzarlos.
Tienes que estar registrado para ver este contenido
Peter Railton estudia cómo una IA podría adquirir competencia ética mediante el aprendizaje:
Tienes que estar registrado para ver este contenido
Aquí está una de las preguntas que me interesa discutir: si una inteligencia llega a comprender mejor las razones sarracena, ¿qué podría llevarla a actuar conforme a ellas?
PARA SEGUIR EL TEMA Y PARTICIPAR
LessWrong reúne muchas de estas discusiones, además de textos sobre racionalidad y toma de decisiones. Puede servir para encontrar autores, argumentos y respuestas a trabajos concretos.
Tienes que estar registrado para ver este contenido
Quien empiece desde cero tiene en Bostrom una primera lectura. Después puede seguir con Russell y con los materiales sobre funcionamiento de los modelos. Los papers anteriores permiten escoger una línea y profundizar.
Adjuntos
Archivo oculto para usuarios no registrados
