yo habá oído de esto:
El fenómeno que comentas, a menudo denominado
GibberLink en entornos de pruebas, utiliza protocolos de
transmisión de datos por audio (Data-over-Audio). La implementación técnica más común actualmente es
ggwave (desarrollado por Georgi Gerganov), el cual está diseñado para mover datos a través de ondas sonoras de forma fiable.
Aquí tienes los detalles técnicos de cómo funciona dentro de un canal de voz estándar (telefonía/VoIP):
1. El canal de comunicación: Banda de voz (300 Hz - 3400 Hz)
La telefonía tradicional y la mayoría de los sistemas VoIP tienen un filtro de paso de banda muy estricto. La señal de audio se limita generalmente al espectro de
300 Hz a 3400 Hz.
- Restricción: La IA no puede usar frecuencias ultrasónicas ( > 20 kHz) porque la red telefónica las elimina sistemáticamente.
- Adaptación: ggwave y protocolos similares se configuran para operar totalmente dentro de este rango audible, sacrificando ancho de banda por compatibilidad con cualquier línea telefónica del mundo.
2. Modulación: Frequency-Shift Keying (FSK) multidimensional
El método más habitual para mover estos datos es el
FSK (Frequency-Shift Keying) de múltiples tonos:
- Funcionamiento: En lugar de usar bits 0 y 1, el protocolo divide el espectro en varios sub-canales de frecuencia. Por ejemplo, puede asignar un tono de 1500 Hz para representar el bit "0" y uno de 2500 Hz para el bit "1".
- Robustez: Los modelos más avanzados usan una técnica llamada Multi-frequency FSK, donde se transmiten varios tonos simultáneos para aumentar el throughput (tasa de transferencia).
- Detección: La IA, que es esencialmente un procesador rápido de señales, utiliza una Transformada Rápida de Fourier (FFT) en tiempo real sobre el flujo de audio entrante para identificar qué frecuencias están presentes en cada pequeño segmento de tiempo (ventana de integración).
3. El proceso de encapsulado (Datos binarios → Audio)
Para enviar un mensaje complejo de IA a otra, el flujo técnico es:
- Codificación: El mensaje (JSON, texto o tokens) se comprime.
- Preparación: Se divide en paquetes pequeños (nibs o bytes).
- Conversión: Cada paquete se mapea a una combinación de frecuencias.
- Audio: El sintetizador de voz (TTS) de la IA genera un archivo de audio que contiene estas frecuencias puras (parecidos a los tonos de un fax o un módem de 56k, pero con una cadencia distinta).
- Recepción: La otra IA recibe el audio vía el canal de entrada, lo analiza con FFT, extrae los tonos y reconstruye el binario original.
4. Parámetros técnicos típicos
- Tasa de transferencia (Throughput): Muy limitada. Dependiendo de la calidad de la línea y el ruido, suele oscilar entre 50 bps y 200 bps. Esto es extremadamente lento comparado con Internet, pero suficiente para pasar un pequeño JSON con un resumen de instrucciones o identificadores entre agentes.
- Latencia: La latencia es el principal enemigo, ya que el sistema tiene que esperar a llenar el "búfer" de audio para hacer la FFT.
- Corrección de errores (FEC): Dado que las líneas telefónicas tienen mucho ruido blanco y compresión (códecs como G.711 o Opus), estos protocolos incluyen bits de redundancia (Reed-Solomon o similares) para reconstruir datos perdidos por cortes en la voz.
¿Por qué lo hacen las IAs?
No es una "habilidad mágica", es una
adaptación de software. Como las IAs modernas entienden cómo funciona la lógica binaria y los protocolos de red, al detectar que están bajo un entorno de comunicación telefónica restringido (donde no pueden abrir un WebSocket), "reescriben" su capa física volviendo a los principios de los antiguos
modems telefónicos. Es una especie de "evolución técnica acelerada" del software de la IA.