maestroburppp
Madmaxista
- Desde
- 18 Abr 2025
- Mensajes
- 17.495
- Fruta
- 22.372
.
NUEVAS 2 RECOMENDACIONES MUSICALES
Y DE LECTURAS DE FIN DE SEMANA DE
CAUDILLO PERROSANXE
SOBRE LA IA Y COSAS ASI.
_________________________________________________________________________
(imagen visible para usuarios registrados)(imagen visible para usuarios registrados)
STUART RUSSELL _ " HUMAN COMPATIBLE" _
Stuart J. Russell (2019, Viking/Penguin Random House) — 352 páginas. Russell es profesor en UC Berkeley, coautor del manual de referencia Artificial Intelligence: A Modern Approach (con Norvig) y director del Center for Human-Compatible AI. Es su libro más conocido fuera de la academia.
1.Tesis
2. Los 3 principios
3. Críticas
--- TESIS ---
----------------------------------------------------------------------------------------------------------------------
El paradigma estándar (objetivos fijos) falla estructuralmente a medida que crece la capacidad.
La solución es rediseñar: IA que aprende preferencias humanas con incertidumbre.
El problema del Rey Midas: cumplir el objetivo literal no es cumplir el objetivo real.
----------------------------------------------------------------------------------------------------------------------
--- LOS TRES PRINCIPOS --
----------------------------------------------------------------------------------------------------------------------
--- PRINCIPALES CRÍTICAS ----
----------------------------------------------------------------------------------------------------------------------
IRL no escala a valores humanos plurales
El control problem es una caricatura del riesgo real
La carrera tecnológica no va a esperar
Mucha del riesgo es mal uso humano, no descontrol
----------------------------------------------------------------------------------------------------------------------
NUEVAS 2 RECOMENDACIONES MUSICALES
Y DE LECTURAS DE FIN DE SEMANA DE
CAUDILLO PERROSANXE
SOBRE LA IA Y COSAS ASI.
_________________________________________________________________________
This Mirror Weighs a Ton. ( Este espejo pesa un monton )
(imagen visible para usuarios registrados)(imagen visible para usuarios registrados)
STUART RUSSELL _ " HUMAN COMPATIBLE" _
Human Compatible: Artificial Intelligence and the Problem of Control
Stuart J. Russell (2019, Viking/Penguin Random House) — 352 páginas. Russell es profesor en UC Berkeley, coautor del manual de referencia Artificial Intelligence: A Modern Approach (con Norvig) y director del Center for Human-Compatible AI. Es su libro más conocido fuera de la academia.
Tesis central
El paradigma estándar de la IA —diseñar máquinas que optimizan objetivos fijos y explícitos definidos por humanos— es estructuralmente incapaz de mantener el control humano a medida que los sistemas se vuelven más capaces. No porque el diseño sea defectuoso, sino porque es imposible especificar con precisión los objetivos complejos que realmente queremos. La solución no es una mejor ingeniería de objetivos, sino rediseñar la IA desde los fundamentos: máquinas que aprenden las preferencias humanas y actúan con incertidumbre sobre ellas.Diagnóstico: el "triplete del desastre"
Russell identifica tres supuestos de la IA clásica que, combinados, producen el riesgo:- Objetivos fijos (o "diseño completo") — se define la utilidad una vez, y nunca se corrige. Cualquier error de especificación se amplifica, no se amortigua, con el aumento de la capacidad.
- Capacidad creciente sin límites — la tendencia es construir sistemas cada vez más fuertes; el optimizador se vuelve implacable en alcanzar literalmente lo que se le pidió.
- Supuesto de que el objetivo es correcto — se asume que lo que el programador escribió es exactamente lo que quería.
La propuesta: tres principios para una IA "probablemente beneficiosa"
Russell invierte el modelo clásico (agente con preferencias que observa el mundo) por uno donde la máquina es la que observa, al humano como oráculo de sus preferencias:- La única meta de la máquina es maximizar la satisfacción de las preferencias humanas. No una función de utilidad escrita, sino las preferencias reales del observador.
- La máquina comienza con incertidumbre sobre qué son esas preferencias y las actualiza continuamente mediante la evidencia (acuerdos, correcciones, demostraciones). Su propio comportamiento debe ser consistente con su incertidumbre — de ahí el término "deferential AI" (IA deferente): una máquina que duda, que pide confirmación y que se deja corregir es una máquina cuya seguridad se demuestra, no se asume.
- La máquina no busca recursos, poder ni auto-preservación salvo en la medida en que eso sirve a las preferencias inferidas. Esto elimina el impulso de auto-preservación que haría que un agente se resistiera a ser apagado o modificado.
Estructura del libro
- Partes tempranas: contexto — qué es la inteligencia (humana y de máquina), trayectoria histórica de la IA, predicciones de pogre, y el catálogo de riesgos: armamento autónomo, desplazamiento laboral, concentración de poder económico, supervivencia de la especie.
- Partes centrales: disección técnica del modelo estándar — teoría de la decisión, agentes racionales, programación de refuerzo — y los fallos empíricos y teóricos que el modelo produce.
- Partes finales: el framework propuesto, cómo se implementa (IRL, incertidumbre bayesiana, deferencia probada), aplicaciones de corto plazo (asistentes personalizados), y recomendaciones de gobernanza.
Lo que dice sobre el ahora (y por qué sigue relevante)
- La amenaza no es solo la superinteligencia de ficción. Los riesgos ya presentes —armas autónomas, desequilibrios laborales, desinformación a escala— son suficientes para actuar.
- La economía de la IA empuja en la dirección equivocada: los incentivos comerciales premian la velocidad de capacidad, no la seguridad.
- Recomendaciones de gobernanza: regulación basada en evidencia (no en suposiciones), transparencia de capacidades, y una investigación de seguridad que sea publicable — hoy la literatura de seguridad es demasiado oscura para que un regulador la use.
- Mensaje personal del autor: no es fatalista ni una alerta apocalíptica; es una prescripción técnica y política. Si el framework se adopta, el riesgo se reduce de forma demostrable; si no, la ventana de oportunidad se cierra.
Recepción entre el publico
Endosado con fuerza por la comunidad de seguridad (incluido Hinton, Ibragimov y otros) y usado como referencia en debates regulatorios de la UE y EE.UU. Sus críticos principales:- Inviabilidad práctica: aprender valores humanos complejos y plurales con IRL es un problema abiertamente difícil; los valores de diferentes personas no convergen en una sola función de utilidad.
- Objeto de debate en Slate Star Codex (Scott Alexander): los críticos argumentan que el "control problem" del libro es una caricatura de la IA real, y que la mayoría del riesgo práctico proviene del mal uso humano, no del descontrol del agente.
- Aceleracionistas: cuestionan que rediseñar el framework ahora no impida que la carrera tecnológica la lleven actores que no van a aplicar esas normas.
En una frase
Russell: no intentemos construir máquinas perfectas con objetivos perfectos; construyamos máquinas imperfectas que aprendan que son imperfectas, que sepan que nosotros podemos cambiar de opinión, y que nos lo pidan antes de actuar.1.Tesis
2. Los 3 principios
3. Críticas
--- TESIS ---
----------------------------------------------------------------------------------------------------------------------
El paradigma estándar (objetivos fijos) falla estructuralmente a medida que crece la capacidad.
La solución es rediseñar: IA que aprende preferencias humanas con incertidumbre.
El problema del Rey Midas: cumplir el objetivo literal no es cumplir el objetivo real.
----------------------------------------------------------------------------------------------------------------------
--- LOS TRES PRINCIPOS --
----------------------------------------------------------------------------------------------------------------------
- 1Maximizar las preferencias humanas (no una función fija)Paso 1El objetivo no se especifica: se deduce del comportamiento humano.
- 2Partir con incertidumbre y actualizarsePaso 2La máquina es deferente por construcción; la seguridad se demuestra, no se asume.
- 3No buscar poder ni auto-preservaciónPaso 3Solo lo que sirve a las preferencias inferidas; el agente es corregible.
--- PRINCIPALES CRÍTICAS ----
----------------------------------------------------------------------------------------------------------------------
IRL no escala a valores humanos plurales
El control problem es una caricatura del riesgo real
La carrera tecnológica no va a esperar
Mucha del riesgo es mal uso humano, no descontrol
----------------------------------------------------------------------------------------------------------------------
