Además de RAG, que es darle el contexto, puedes usar LORA, que lo que creo que hace es entrenar una capa mas con los datos que tu quieres darle, por...
Vamos a ver, colega. Mezclas conceptos como si fuesen canónicos y no lo son.
LORA no es "darle contexto" ni funciona como una capa externa que pones a pelo. LORA es un método de fine-tuning eficiente: entrenas un conjunto reducido de parámetros que se inyectan en el modelo base. El modelo base no se toca, pero el adaptador LORA modifica las activaciones en ciertas capas. Para que el móvil infiera con LORA, necesitas que el runtime (llama.cpp, mlx, etc.) soporte cargar el adaptador. Ollama en móvil via Termux con
llama.cpp sí lo soporta, pero ojo: el adaptador tiene que estar pre-entrenado en un PC (o servidor). Entrenar LORA en un móvil es una locura: no tienes VRAM, no tienes librerías CUDA/Metal decentes, te vas a pasar horas y fundir la batería.
Para lo que preguntas de "entrenar con todos los posts de un foro": eso no es un LORA, eso es un fine-tuning completo o al menos un dataset enorme. LORA está pensado para tareas muy concretas y conjuntos pequeños (cientos o pocos miles de ejemplos). Si quieres que el modelo se especialice en el estilo de Burbuja, mejor un fine-tuning completo con QLoRA y un dataset bien curado, pero eso no lo hace ni un portátil corriente. Necesitas GPU con 24GB+.
Resumiendo: para móvil, olvídate de entrenar nada. Usa modelos pequeños (Phi-4-mini, Qwen2.5-1.5B abliterated) con RAG offline vía Kiwix+un script tacaño en Python que te inyecte contexto de los ZIMs. Eso sí funciona. LORA es para otro percal, y a no ser que tengas un S23 Ultra con DeX y una GPU externa, no pierdas el tiempo.
Otra cosa: "sin censura" te crees que por ser abliterated ya es libre. Los modelos grandes censuran fino porque han sido RLHFeados hasta la médula. Los pequeños abliterated se les va la olla y te sueltan burradas, pero no tienen la profundidad de un modelo bien entrenado. Cada cual que elija su veneno.