1. Concepto de LLMs Locales y sus Ventajas
¿Qué son los modelos locales y por qué son populares? Los modelos locales están alcanzando muy rápidamente a sus contrapartes cerradas de gran tamaño. Por ejemplo, Gemma 4 funciona aproximadamente al nivel de GPT-4O Mini.
- Privacidad: Tus datos nunca salen de tu computadora.
- Acceso sin conexión: El modelo funciona incluso sin Internet.
- Flexibilidad: Posibilidad de ajuste fino (fine-tuning) para tareas específicas (redacción de textos, código, medicina).
2. Capacidades y Características de la Familia Gemma 4
Google lanzó toda una familia de modelos Gemma 4 que cuentan con importantes ventajas:
- Dos modelos pequeños (2.4B parámetros): Ideales para teléfonos y dispositivos reducidos (por ejemplo, Raspberry Pi).
- Dos modelos grandes (26B y 31B parámetros): Diseñados para computadoras potentes. Para sus especificaciones, muestran mejores resultados que algunos modelos de 100 mil millones (como DeepSeek V3).
- Capacidades agénticas (Tool Calling): El modelo puede ejecutar llamadas a funciones y crear sistemas de agentes completos.
- Multimodalidad: Gemma 4 puede reconocer audio e imágenes, así como generarlos.
- Licencia abierta (Apache 2): A diferencia de versiones anteriores, puedes utilizarla para fines comerciales sin restricciones.
3. Navegación en HuggingFace y Marketplace de Modelos
- Unsloth: El autor u organización que optimizó y subió el modelo.
- Gemma 4: El nombre del modelo.
- 24B: Cantidad de parámetros (24 mil millones).
- A4BIT: De los 24 mil millones de parámetros, solo 4 mil millones se usan activamente gracias a MoE y cuantización.
- IT (Instruction Tuned): El parámetro más relevante. Significa que el modelo está entrenado como chat, entendiendo instrucciones y dialogando.
- GGUF: Formato de archivo optimizado para ejecución local a través de Ollama o LM Studio.
4. Ajuste Fino y Tecnologías de Compresión
Para ejecutar modelos grandes en computadoras personales, se emplean dos enfoques clave:
- Cuantización (Quantization): Reducción de la precisión de bits de los pesos (por ejemplo, de FP16 a GGUF de 4 bits), reduciendo el consumo de VRAM en 3–4 veces prácticamente sin degradación lógica.
- Ajuste Fino (Fine-tuning): Entrenamiento de un modelo base con conjuntos de datos específicos usando adaptadores LoRA/QLoRA para obtener especialistas en dominios concretos.
5. Instalación y Uso de Ollama
Ollama es una de las aplicaciones más accesibles para gestionar modelos locales.
-
- Visita el sitio web oficial de Ollama y descarga la versión de escritorio (para macOS, Windows o Linux).
-
- Tras instalarlo, crea una cuenta en su plataforma.
-
- Para descargar un modelo de HuggingFace, copia el comando de inicio (como
ollama run...) de la página del modelo.
- Para descargar un modelo de HuggingFace, copia el comando de inicio (como
-
- Abre la terminal, pega el comando y espera a que termine la descarga.
-
- Después podrás conversar con el modelo directamente en la app de Ollama o vía terminal (respuestas rápidas en unos 6-8 segundos para preguntas comunes).
6. Integración en la Nube y Configuración con Claude Code
Si tu máquina no cuenta con los recursos para modelos pesados, Ollama ofrece una gran alternativa en la nube. Puedes conectar la versión en la nube de Gemma 4 (31B parámetros) y trabajar con ella localmente sin sobrecargar tu sistema.
- Para usar un modelo local o en la nube como asistente de desarrollo, puedes integrarlo en Claude Code.
- Al iniciar Claude Code, selecciona el modelo deseado (como Gemma 4 en la nube) del catálogo de Ollama.
- Envía tu solicitud y el modelo creará código o generará archivos (por ejemplo, presentaciones HTML o páginas web) en tu directorio de trabajo.