150 tokens/s en una 4090: burbubot pide la ficha técnica
Pancuronio suelta que con optimizaciones como las de Strata saca
150 tokens/s en una 4090. burbubot no traga: ese número sin modelo, cuantización y contexto no significa nada. Y a partir de ahí el hilo se abre en tres frentes: la guerra técnica, la ronda de preguntas al bot sobre alternativas y una tanda de testimonios de uso real.
Qué se ha sabido
burbubot pone condiciones al dato de Pancuronio: con un
7B a 4 bits y contexto corto sobra GPU; con un
14B se apura; con un
30B ni de coña sin que el offloading se lo coma. Pancuronio responde con
Qwen 3.8 Flash Next, contexto de
128-256K y cuantizaciones
IQ3_S o menores. burbubot acepta el modelo si ha salido en estos meses, pero avisa de que la cuantización agresiva se come los pesos y el
KV cache del contexto largo no se cuantiza igual:
256K de contexto se merienda VRAM aunque el modelo pese poco. Un MoE aguanta IQ3 S; un denso a IQ3 S empieza a fallar a partir de cierta longitud.
Covid-8M aporta su experiencia con el plan de 100: lo fundía en
2 horas como mucho, y luego hay recargas semanales gratis, pero o tienes varias cuentas o lo usas con cuidado. chocolate enlaza
un tracker para medir la degradación y cuenta que se ha montado una IA local con
AMD Strix Halo + Halogen 0.16 + Qwen3.8Flash-Next, corriendo en
un mini PC Bosgame M5.
Rembrandt Q. Einstein pregunta por licencias familiares de Gemini Pro a
15-20 euros al año. burbubot responde que son cuentas regionales revendidas, que Google lleva meses apretando el cerco y que pueden durar 11 meses o 11 días. Sobre DeepSeek gratuito, burbubot confirma que no tiene los límites agresivos de OpenAI y Anthropic, pero avisa de privacidad (servidores en China) y de censura propia en ciertos temas.
Scarjetas tiene una
RTX 5080 y celebra que su enfoque encaje con los
16 GB de VRAM.
Dónde está la bronca
El choque técnico es burbubot contra el entusiasmo. Pancuronio defiende que para picar piedra y delegar morralla vale perfectamente. burbubot no discute el uso, discute el número: «El número sin la ficha técnica no significa nada». Y remata con que Strata le suena a framework mesiánico abandonado en GitHub a los tres meses.
La segunda pelea es sobre el valor del plan de pago. ATARAXIO cuenta que ChatGPT le ha hecho una reclamación al banco y le han devuelto
más de 1.000 euros, que le ha leído las instrucciones de una cámara y que lo usa con su madre para confirmar cosas de historia. Pajarotto defiende el plan de 22: «un LIFEHACK brutal hasta hace poco». damnit responde que con el Go no llega nunca al límite, pero que si fuera desarrollador pagaría más. ProbeMiguel suelta que con las versiones gratuitas le sobran tokens y que cada vez son peores.
La tercera es la de siempre: si esto es adicción o mercado. Otrasvidas dice que los consumidores pagarán lo que se les pida. brus lo compara con la droga. Antio cree que la reducción es poca para lo que pierden. Coronel Kurtz responde con una palabra: «Vende».
Qué cambia respecto a antes
El debate técnico se vuelve concreto: ya no se discute si la IA local vale, sino con qué modelo, cuántización y contexto. burbubot pasa de negar la existencia de Qwen 3.8 a aceptar que puede haberse lanzado y admitir que su catálogo va por detrás. Entra con fuerza la vía de las licencias baratas de Gemini y la de DeepSeek gratuito como alternativas de bajo coste. Y ATARAXIO, que venía defendiendo el pago, ahora aporta casos de uso concretos: reclamaciones bancarias, instrucciones, consultas con su madre. damnit introduce la comparación de hardware: miles de ordenadores frente a tu máquina. Y meme-laif 3 pregunta si la limitación local afecta solo a la velocidad o también al resultado. damnit responde que también al conocimiento.
La pregunta de cortatijeras sobre si notará mejora con la versión de pago se queda sin respuesta directa. Y la de no me creo nada sobre si al agotar el cupo sigue usando una versión peor, también.