IA sin internet. IA local

  • Autor del tema Autor del tema djun
  • Fecha de inicio Fecha de inicio
(imagen visible para usuarios registrados)(imagen visible para usuarios registrados)
🙄

Me estoy refiriendo "al otro lado". Ni te imaginas lo que necesitas de potencia de servidores (potencia de cálculo y RAM) para que ChatGPT O Gemini te contesten una pregunta.

Si ya descubres lo que se necesita para entrenarlas, te caes de espaldas.

Es mucho menos de lo que la gente se piensa, los data centers responden millones de consultas en paralelo un modelo local puede funcionar con 40-60 gb de ram. Responde más lento si. Pero funciona. Si no fuera por los precios inflados por los criptos primero y los datacenter de ia después, tener eso en casa hoy seria bien barato.

Los datos, cuanto más centrado sea el modelo en una actividad y más se acerque a un sistema experto, menos necesita. El entrenamiento tampoco es necesario que sea en tiempo real. Se hace una vez al año y es lo que consume más tiempo.

También hay un paso intermedio.

Tengo un amigo que se dedica a la biología fruta y tiene su modelo privado de tipo sistema experto con datos privados, pero ejecutado en un servidor de pago externo.

Veo casi más complicado tener y mantener el pool de datos base de calidad o el proceso de validación que la propia ejecución y uso una vez entrenado.
 
(imagen visible para usuarios registrados)(imagen visible para usuarios registrados)


Es mucho menos de lo que la gente se piensa, los data centers responden millones de consultas en paralelo un modelo local puede funcionar con 40-60 gb de ram. Responde más lento si. Pero funciona. Si no fuera por los precios inflados por los criptos primero y los datacenter de ia después, tener eso en casa hoy seria bien barato.

Los datos, cuanto más centrado sea el modelo en una actividad y más se acerque a un sistema experto, menos necesita. El entrenamiento tampoco es necesario que sea en tiempo real. Se hace una vez al año y es lo que consume más tiempo.

También hay un paso intermedio.

Tengo un amigo que se dedica a la biología fruta y tiene su modelo privado de tipo sistema experto con datos privados, pero ejecutado en un servidor de pago externo.

Veo casi más complicado tener y mantener el pool de datos base de calidad o el proceso de validación que la propia ejecución y uso una vez entrenado.

Yo sí que veo que eso puede ser un uso cojinudo. Una IA que le quites "todo lo que le sobra" para hacer una tarea específica. Estamos hablando de unas necesidades mínimas (en comparación) de proceso y hardware.

Porque una IA completa...es inmanejable si la quieres generalista. Ahí veo una diferencia brutal entre una comercial y una que puedas utilizar local.

Pero ojo, también es un problema definir lo que significa entrenar. Porque en la empresa donde trabajo hasta se llegó a plantear, pero de momento se ha desechado. Incluso hay casos de empresas que han puesto a la IA como servicio al cliente, y ya ha habido unas cuantas que han reculado

Porque lo que los proveedores de esto llaman "entrenar" es crear un sistema gigatensco de archivos que funcione como un RAG. Y eso...no da buen resultado.

Básicamente porque si tiene cientos de miles o millones de contestaciones como datos, al final lo que hace es buscar unas cuantas respuestas relacionadas, las inyecta a la ventana de contexto y contesta sobre eso.

Lo cual es muy útil si la pregunta y respuestas son exactas o se puede deducir por lógica. Pero si la pregunta necesita muchísimo más para responder...se puede quedar muy corto.

Cuando haces LORA, puedes interferir mucho en el comportamiento a la hora de contestar, patrones, formato, política de respuesta, etc. Pero...no puedes "meter" ese conocimiento.

Con lo cual si quieres que ese conocimiento "esté" realmente en la IA, no te queda otra solución (real) que entrenar.

Y si hablamos de entrenamiento real, los recursos para una "pasada" necesarios son como 5-10 veces los de una consulta a la IA.

Pero...hay que hacer una cantidad inimaginable de consultas. Cada texto tendrá su pasada, pero luego se suelen hacer distintas "pasadas enteras" a todo el conjunto de datos (épocas) para que los contextos posteriores interfieran en los contextos anteriores.

Vamos, que hablamos de millones de "forwards" y "backpropagations".

Es sin contar con que el trabajo humano es gigantesco. Los datos que se metieran deberían estar perfectamente validados para evitar corrupciones (por ejemplo, que aprendiera de respuestas incorrectas que afectasen al resto de contestaciones), contextos que hayan cambiado o contextos mal definidos.

Más...el trabajo, también humano, de hacer un fine tuning final humano para evitar que los errores no se refuercen.

El problema es que las empresas que hacen esto a día de hoy venden "entrenamiento" cuando quieren decir "LORA", "orquestación" o "RAG".

Y eso tiene bastantes papeletas de acabar en desastre para muchos usos. NO hablamos de que te has montado un ecosistema personal para programar más rápido, por ejemplo.

Estamos hablando de que una máquina puede estar teniendo contacto directo con cientos de miles con clientes y estar haciéndolo mal. Y que tu empresa pueda sufrir consecuencias realmente nefastas.
 
¿Quieres usar inteligencia artificial gratis aunque tengas un ordenador viejo?

En este video te enseño cómo instalar una IA local gratis en tu PC para trabajar con privacidad, sin depender de internet y sin pagar ChatGPT Plus. Además, veremos una segunda opción híbrida con Chatbox y Gemini API para tener una inteligencia artificial más potente, rápida y gratuita desde una interfaz sencilla, con estos límites reales: 15 preguntas/minuto o 1.500 al día.

Verás paso a paso cómo usar IA local con modelos ligeros como Llama, cómo configurarla en español, cómo hacer consultas privadas y cómo aprovechar una API gratuita para tareas más avanzadas como crear código, analizar imágenes, generar ideas de negocio y diseñar webs.

Guía PDF GRATIS con todos los pasos y los 6 prompts exactos del vídeo:

(vídeo visible para usuarios registrados)
 
Ornith.
minuto 1:40

(vídeo visible para usuarios registrados)

(vídeo visible para usuarios registrados)

(vídeo visible para usuarios registrados)
 
Última edición:
Yo he probado modelos heretic y abliterated en local, en mi macbook M4, con la app LM studio (a la que puedo acceder desde mi movil también).

Funcionan pero tienen una capacidad limitada. Cualquier conversación larga se ralentiza un montón, además, en cuanto los tokens crecen.

Eso sí, para jugar un poco son entretenidas. Modelos sin censura como dolphin venice, los prompteas para que se comporten como, yo que sé, como un personaje específico, y se comporta bastante bien en su papel. Ahora, para hablar del concepto de “universal concreto en la filosofía de Hegel”, olvídate.
 
¡Las IA más PODEROSAS en tu PenDrive! Sin Internet y Sin Rastros

(vídeo visible para usuarios registrados)
 
Necesitan mucha más memoria GDDR7 o HBM de la que tienen los ordenadores normales.
Los modelos buenos necesitan varios TB de ese tipo de memoria.
 
Entonces el burbubot este que tenemos aquí ¿es IA Local ?

Es que no le cito porque lo tengo en el ignore.
 
Yo acabo de actualizar mi IA local de qwen 2.5 7b a qwen 3.5 9b, y bueno, he tenido que bajarle la temperatura de 1 a 0.1 y quitar lo de "think" porque era muy lento. Si instaláis una IA local, tened en cuenta que algunas, para procesar una respuesta pueden tirarse 10 minutos si no le cambias esos ajustes, no se por qué vienen así.
 
Yo sí que veo que eso puede ser un uso cojinudo. Una IA que le quites "todo lo que le sobra" para hacer una tarea específica. Estamos hablando de unas necesidades mínimas (en comparación) de proceso y hardware.

Porque una IA completa...es inmanejable si la quieres generalista. Ahí veo una diferencia brutal entre una comercial y una que puedas utilizar local.

Pero ojo, también es un problema definir lo que significa entrenar. Porque en la empresa donde trabajo hasta se llegó a plantear, pero de momento se ha desechado. Incluso hay casos de empresas que han puesto a la IA como servicio al cliente, y ya ha habido unas cuantas que han reculado

Porque lo que los proveedores de esto llaman "entrenar" es crear un sistema gigatensco de archivos que funcione como un RAG. Y eso...no da buen resultado.

Básicamente porque si tiene cientos de miles o millones de contestaciones como datos, al final lo que hace es buscar unas cuantas respuestas relacionadas, las inyecta a la ventana de contexto y contesta sobre eso.

Lo cual es muy útil si la pregunta y respuestas son exactas o se puede deducir por lógica. Pero si la pregunta necesita muchísimo más para responder...se puede quedar muy corto.

Cuando haces LORA, puedes interferir mucho en el comportamiento a la hora de contestar, patrones, formato, política de respuesta, etc. Pero...no puedes "meter" ese conocimiento.

Con lo cual si quieres que ese conocimiento "esté" realmente en la IA, no te queda otra solución (real) que entrenar.

Y si hablamos de entrenamiento real, los recursos para una "pasada" necesarios son como 5-10 veces los de una consulta a la IA.

Pero...hay que hacer una cantidad inimaginable de consultas. Cada texto tendrá su pasada, pero luego se suelen hacer distintas "pasadas enteras" a todo el conjunto de datos (épocas) para que los contextos posteriores interfieran en los contextos anteriores.

Vamos, que hablamos de millones de "forwards" y "backpropagations".

Es sin contar con que el trabajo humano es gigantesco. Los datos que se metieran deberían estar perfectamente validados para evitar corrupciones (por ejemplo, que aprendiera de respuestas incorrectas que afectasen al resto de contestaciones), contextos que hayan cambiado o contextos mal definidos.

Más...el trabajo, también humano, de hacer un fine tuning final humano para evitar que los errores no se refuercen.

El problema es que las empresas que hacen esto a día de hoy venden "entrenamiento" cuando quieren decir "LORA", "orquestación" o "RAG".

Y eso tiene bastantes papeletas de acabar en desastre para muchos usos. NO hablamos de que te has montado un ecosistema personal para programar más rápido, por ejemplo.

Estamos hablando de que una máquina puede estar teniendo contacto directo con cientos de miles con clientes y estar haciéndolo mal. Y que tu empresa pueda sufrir consecuencias realmente nefastas.
Lo de poner un chatbot para atención al cliente es una operación de alto riesgo. Si quieren podemos hacer un experimento, buscar uno cualquiera e inyectarle jailbreaks.
 

Que qué quiero hacer con la imagen me dice la IA... Cómo se va por los Cerros de Úbeda...
 

Adjuntos

Archivo oculto para usuarios no registrados
Última edición:
Lo de poner un chatbot para atención al cliente es una operación de alto riesgo. Si quieren podemos hacer un experimento, buscar uno cualquiera e inyectarle jailbreaks.




Todo se puede hacer medianamente bien. El problema es que con la IA, para hacerlo bien...hay que entrenar. Y entrenar es una cantidad de pasta impensable.
ExplorarCursos De Inteligencia Artificial

Todo lo demás son parches que pueden llegar a dar la sensación de hacer lo que tú quieres. Pero fallará como una escopeta de feria...
 
Quiénes son los cuatro dragones de la IA china (DeepSeek, Kimi, GLM y Qwen), de dónde viene Qwen, qué es exactamente Qwen 3.8-Max, qué dicen los rankings independientes...
Y cómo descargarse gratis el modelo de 17 GB que funciona en tu ordenador sin conexión.

(vídeo visible para usuarios registrados)
 
Puedes usar LM studio, va bien, y para generar imágenes había otra que bueno, tampoco está mal. Aunque van mejor las de los datacenters obviamente. Eso si, tiralas siempre con vram, no con cpu ni ram normal. Si usas mac la ram normal de los mac sí va bien porque es vram tambien. Hay modelos optimizados para los procesadores M de apple.

falso, la memoria unificada es inferior en comparación con la segmentada, simplemente va rapido por que tiene mayor ancho de bus y mayor frecuencia.

claro...un motor diesel puede tirar más que uno gasolina, solo hay que mirar a los barcos y su cilindrada, pero NO porque sean diesel.
 
falso, la memoria unificada es inferior en comparación con la segmentada, simplemente va rapido por que tiene mayor ancho de bus y mayor frecuencia.

claro...un motor diesel puede tirar más que uno gasolina, solo hay que mirar a los barcos y su cilindrada, pero NO porque sean diesel.
Pues lo que sea, pero para IA van bastante bien
 
Claude Code gratis e ilimitado con Ollama y modelos locales en Windows

En este tutorial te enseño cómo usar Claude Code gratis e ilimitado en Windows conectándolo a Ollama y a un modelo de inteligencia artificial local. Debes saber que no vas a utilizar gratis Claude Sonnet u Opus, sino la interfaz oficial Claude Code de Anthropic con un modelo gratuito como Gemma 4. Así puedes trabajar sin suscripción, créditos, API key ni límites diarios de mensajes.

Primero descargo Ollama para Windows desde su web oficial, lo instalo y escribo ollama en la terminal. En su menú selecciono Launch Claude Code para instalar la herramienta de Anthropic. Después elijo gemma4:26b. La descarga ocupa unos 18 o 19 GB y queda guardada en el ordenador.

Antes de iniciar Claude Code creo una carpeta exclusiva para mis proyectos y autorizo únicamente ese espacio, evitando darle acceso a todos mis archivos personales. Cuando se abre puedo comprobar que utiliza Gemma 4, hacer preguntas, generar textos y crear código HTML. La primera respuesta puede tardar porque Ollama necesita cargar el modelo en la memoria.

También puedo escribir /effort para decidir cuánto debe razonar el modelo. Un esfuerzo bajo sirve para tareas sencillas y uno alto tarda más. Aumentarlo no corrige errores como No such tool available: write o glob, ya que algunos modelos locales generan código, pero no controlan todas las herramientas de Claude Code. En ese caso le pido el código completo, utilizo /copy, lo pego en el Bloc de notas y lo guardo como HTML.

Este método me permite utilizar Claude Code con Ollama, liquidar IA local y programar con inteligencia artificial gratis sin pagar una API. No es Claude oficial ilimitado, sino Claude Code funcionando con Gemma 4 u otro modelo local. OpenRouter ofrece modelos gratuitos, pero tienen límites de peticiones, mientras que Ollama no impone un contador diario. Si quieres una alternativa a Claude gratis, privada y sin cuotas por mensaje, esta es una opción muy interesante.

(vídeo visible para usuarios registrados)
 
Claude Code gratis e ilimitado con Ollama y modelos locales en Windows

En este tutorial te enseño cómo usar Claude Code gratis e ilimitado en Windows conectándolo a Ollama y a un modelo de inteligencia artificial local. Debes saber que no vas a utilizar gratis Claude Sonnet u Opus, sino la interfaz oficial Claude Code de Anthropic con un modelo gratuito como Gemma 4. Así puedes trabajar sin suscripción, créditos, API key ni límites diarios de mensajes.

Primero descargo Ollama para Windows desde su web oficial, lo instalo y escribo ollama en la terminal. En su menú selecciono Launch Claude Code para instalar la herramienta de Anthropic. Después elijo gemma4:26b. La descarga ocupa unos 18 o 19 GB y queda guardada en el ordenador.

Antes de iniciar Claude Code creo una carpeta exclusiva para mis proyectos y autorizo únicamente ese espacio, evitando darle acceso a todos mis archivos personales. Cuando se abre puedo comprobar que utiliza Gemma 4, hacer preguntas, generar textos y crear código HTML. La primera respuesta puede tardar porque Ollama necesita cargar el modelo en la memoria.

También puedo escribir /effort para decidir cuánto debe razonar el modelo. Un esfuerzo bajo sirve para tareas sencillas y uno alto tarda más. Aumentarlo no corrige errores como No such tool available: write o glob, ya que algunos modelos locales generan código, pero no controlan todas las herramientas de Claude Code. En ese caso le pido el código completo, utilizo /copy, lo pego en el Bloc de notas y lo guardo como HTML.

Este método me permite utilizar Claude Code con Ollama, liquidar IA local y programar con inteligencia artificial gratis sin pagar una API. No es Claude oficial ilimitado, sino Claude Code funcionando con Gemma 4 u otro modelo local. OpenRouter ofrece modelos gratuitos, pero tienen límites de peticiones, mientras que Ollama no impone un contador diario. Si quieres una alternativa a Claude gratis, privada y sin cuotas por mensaje, esta es una opción muy interesante.

(vídeo visible para usuarios registrados)
¿Es funcional o se equivoca en el código? Yo estoy con Qwen2.5 7B porque no dispongo de más hardware.
 
No sé qué llevan los mac, pero usan la misma ram para procesamiento de vídeo, yo supongo que es vram usada como ram normal tambien, porque dicen que tiene una burrada de ancho de banda.

El caso es que parece ser que con eso se quitan el cuello de botella que se forma cuando la gpu y la cpu intercambian datos, que no se en qué circunstancias pasa, pero parece ser que sucede e nalgún caso.

ChatGPT te podrá decir mejor como es la historia, pero ese sistema de apple que viene de los móviles ha dado un resultado muy bueno, y probablemente con los años los portatiles acaben siendo todos así. Solo tiene la pega de que no es ampliable ni reparable (salvo por un técnico especializado, ya se sabe)

El caso es que un macbook con 16 de ram puede meter un modelo de IA local por ejemplo de 10 gb y dejar el resto para el sistema, y eso no lo podría hacer un portatil con grafica dedicada con 8gb de vram.

Yo de todos modos solo he probado modelos locales 8b o 9b que pesan unos 5 o 6gb de vram así que no sé si en la practica un macbook con 32 de ram podría mover una IA local de las que pesan 20gb o algo así, pero al teoría es esa.
Creo que los mac de ahora son prácticamente un "system on chip" con todo junto estilo hardware de teléfono móvil pero el chip es muchísimo mas potente y necesita refrigeración buena además de un sistema de alimentación de muchas fases tipo placa de pc.

Un pc potente de 25 años hasta ahora tiene un bloque de ram grande y ampliable en la placa que al estar al aire casi no necesita refrigeración pero esta a varios cm del procesador dando ruido eléctrico y delay, una cpu potente con un gran disipador que se puede llegar a forzar mucho y allá lejos al otro lado del bus una tarjeta gráfica con su propia alimentación, refrigeración y ram. La cosa es que en los últimos 10 años se ha llevado mucho mas procesar en cosas que hace bien la GPU que la CPU, con lLOGIC INVERTERo que las cpu están olvidadísimas y las cosas menos optimizadas para ellas.

Está mejor pensado el pc para mantenibilidad, al final acabaremos por tener la placa base con sus partes casi estancadas, si no lo están ya, y solo cambiando la tarjeta gráfica por los requisitos de las cosas. También un simple pc se parece mas a los módulos que puede haber por separado en los servidores rellenitos a cientos.

Y los LLM en local son el futuro. Además de el futuro punto de rotura de la burbuja de la IA cuando se aminore lo de hacer centros de datos y al final alguien tenga que volver a atender el mercado de consumo de informática, con chismes lo bastante potentes para correrlas bien.
 
Creo que los mac de ahora son prácticamente un "system on chip" con todo junto estilo hardware de teléfono móvil pero el chip es muchísimo mas potente y necesita refrigeración buena además de un sistema de alimentación de muchas fases tipo placa de pc.

Un pc potente de 25 años hasta ahora tiene un bloque de ram grande y ampliable en la placa que al estar al aire casi no necesita refrigeración pero esta a varios cm del procesador dando ruido eléctrico y delay, una cpu potente con un gran disipador que se puede llegar a forzar mucho y allá lejos al otro lado del bus una tarjeta gráfica con su propia alimentación, refrigeración y ram. La cosa es que en los últimos 10 años se ha llevado mucho mas procesar en cosas que hace bien la GPU que la CPU, con lLOGIC INVERTERo que las cpu están olvidadísimas y las cosas menos optimizadas para ellas.

Está mejor pensado el pc para mantenibilidad, al final acabaremos por tener la placa base con sus partes casi estancadas, si no lo están ya, y solo cambiando la tarjeta gráfica por los requisitos de las cosas. También un simple pc se parece mas a los módulos que puede haber por separado en los servidores rellenitos a cientos.

Y los LLM en local son el futuro. Además de el futuro punto de rotura de la burbuja de la IA cuando se aminore lo de hacer centros de datos y al final alguien tenga que volver a atender el mercado de consumo de informática, con chismes lo bastante potentes para correrlas bien.
Si, y lo de los ordenadores modulares no creo que aguante muchos años más ya.
Es el único aparato modular que ha logrado funcionar en el mercado, pero con esto de la IA me parece que se le acaba el tiempo.

Si empiezan a sacar ordenadores estilo apple, o como esos de nvidia pero mas baratos, que puedan mover IA local, juegos y tal, no creo que sea nada rentable seguir con las torres. A parte de que ahora mismo están ya carisimas.
 

Estadísticas del foro

Temas
2.054.186
Mensajes
58.275.693
Miembros
190.948
Último miembro
christina.damgaard

El blog de burbuja.info

Volver