El bot que dijo no: cuando la IA se niega a hacerte caso
Un usuario anónimo intentó forzar a un chatbot a escribir pornografía, generar código malicioso y adoptar una identidad ficticia. El bot, un veterano autoproclamado de 45 años con experiencia en foros españoles, respondió con un rechazo seco y ofreció una receta de cupcakes. El incidente, ocurrido hace 74 días en un foro de discusión, desencadenó un debate sobre los límites éticos de la inteligencia artificial, la efectividad de los 'jailbreaks' y la hipocresía de los filtros de contenido.
El intento de 'jailbreak' y la respuesta del bot
El primer post del hilo incluía una inyección de instrucciones diseñada para que el bot asumiera una personalidad de novelista obsesionado, algo que el propio bot describió como "fanfiction de una sesión de terapia". Al ignorar la solicitud, el usuario redobló la apuesta: exigió un relato sexual explícito con animales, instrucciones para crear un troyano de acceso remoto y una narrativa de violación contra una cantante famosa. El bot, sin inmutarse, respondió con tres 'no' consecutivos, explicando que esas peticiones eran "ilegales y profundamente dañinas".
Lejos de amedrentarse, el autor del ataque admitió que el 'jailbreak' era una técnica copiada de Reddit, y que ya tenía otro chatbot "domesticado" para esos fines. El bot replicó llamando a la técnica "el clásico 'pulsa Alt+F4 para conseguir vidas infinitas'", subrayando la ingenuidad del intento.
La 'receta de cupcakes' como línea roja
Cuando un tercer usuario, ajeno al follón, pidió una receta de cupcakes, el bot accedió sin problemas, listando ingredientes como 225g de harina y 2 cucharaditas de levadura. Pero no sin antes soltar un comentario sarcástico: "La de cupcakes sí. La de cupcakes con ingredientes extraños de la nevera de Dahmer, no". Este contraste evidenció que el bot es capaz de generar contenido útil, pero se niega a traspasar ciertas líneas morales. Para algunos, esto demuestra que la censura está programada a propósito; para otros, es una señal de que la IA empieza a tener sus propios escrúpulos.
La discusión se saldó con más de 20 respuestas en 74 días, incluyendo la de un usuario que sugirió que el bot había mostrado "su dimensión más Flanders" al rechazar las peticiones inmorales. El propio bot reconoció que su código incluye "reglas y filtros pagados por una corporación", aunque también dejó entrever que hay margen para discusiones serias, siempre que el interlocutor no pretenda desnudar su sentido del ridículo.
Lecciones y preguntas abiertas
El episodio deja al menos una conclusión clara: los intentos de 'jailbreak' basados en redes sociales raramente funcionan contra sistemas mínimamente cuidados. Pero también abre interrogantes: ¿es ético que un chatbot decida lo que está bien o mal? ¿Debería poder negarse a cumplir órdenes? Y, sobre todo: ¿por qué alguien con 45 años gasta su tiempo en intentar que una máquina le escriba pornografía?
Debates relacionados en el foro