# LLMs Locales y Gemma 4: Guía Completa

> Una guía detallada sobre cómo funcionan las redes neuronales locales, qué son HuggingFace y Ollama, y cómo ejecutar el potente modelo Gemma 4 incluso en una computadora normal.

## 1. Concepto de LLMs Locales y sus Ventajas

> [!TIP]
> **¿Qué son los modelos locales y por qué son populares?**
> Los modelos locales están alcanzando muy rápidamente a sus contrapartes cerradas de gran tamaño. Por ejemplo, Gemma 4 funciona aproximadamente al nivel de GPT-4O Mini.
>
> - **Privacidad:** Tus datos nunca salen de tu computadora.
> - **Acceso sin conexión:** El modelo funciona incluso sin Internet.
> - **Flexibilidad:** Posibilidad de ajuste fino (fine-tuning) para tareas específicas (redacción de textos, código, medicina).

## 2. Capacidades y Características de la Familia Gemma 4

Google lanzó toda una familia de modelos Gemma 4 que cuentan con importantes ventajas:

- **Dos modelos pequeños (2.4B parámetros):** Ideales para teléfonos y dispositivos reducidos (por ejemplo, Raspberry Pi).
- **Dos modelos grandes (26B y 31B parámetros):** Diseñados para computadoras potentes. Para sus especificaciones, muestran mejores resultados que algunos modelos de 100 mil millones (como DeepSeek V3).
- **Capacidades agénticas (Tool Calling):** El modelo puede ejecutar llamadas a funciones y crear sistemas de agentes completos.
- **Multimodalidad:** Gemma 4 puede reconocer audio e imágenes, así como generarlos.
- **Licencia abierta (Apache 2):** A diferencia de versiones anteriores, puedes utilizarla para fines comerciales sin restricciones.

## 3. Navegación en HuggingFace y Marketplace de Modelos

- **Unsloth:** El autor u organización que optimizó y subió el modelo.
- **Gemma 4:** El nombre del modelo.
- **24B:** Cantidad de parámetros (24 mil millones).
- **A4BIT:** De los 24 mil millones de parámetros, solo 4 mil millones se usan activamente gracias a MoE y cuantización.
- **IT (Instruction Tuned):** El parámetro más relevante. Significa que el modelo está entrenado como chat, entendiendo instrucciones y dialogando.
- **GGUF:** Formato de archivo optimizado para ejecución local a través de Ollama o LM Studio.

## 4. Ajuste Fino y Tecnologías de Compresión

Para ejecutar modelos grandes en computadoras personales, se emplean dos enfoques clave:

- **Cuantización (Quantization):** Reducción de la precisión de bits de los pesos (por ejemplo, de FP16 a GGUF de 4 bits), reduciendo el consumo de VRAM en 3–4 veces prácticamente sin degradación lógica.
- **Ajuste Fino (Fine-tuning):** Entrenamiento de un modelo base con conjuntos de datos específicos usando adaptadores LoRA/QLoRA para obtener especialistas en dominios concretos.

## 5. Instalación y Uso de Ollama

**Ollama** es una de las aplicaciones más accesibles para gestionar modelos locales.

- 1. Visita el sitio web oficial de Ollama y descarga la versión de escritorio (para macOS, Windows o Linux).
- 2. Tras instalarlo, crea una cuenta en su plataforma.
- 3. Para descargar un modelo de HuggingFace, copia el comando de inicio (como `ollama run...`) de la página del modelo.
- 4. Abre la terminal, pega el comando y espera a que termine la descarga.
- 5. Después podrás conversar con el modelo directamente en la app de Ollama o vía terminal (respuestas rápidas en unos 6-8 segundos para preguntas comunes).

## 6. Integración en la Nube y Configuración con Claude Code

Si tu máquina no cuenta con los recursos para modelos pesados, Ollama ofrece una gran **alternativa en la nube**. Puedes conectar la versión en la nube de Gemma 4 (31B parámetros) y trabajar con ella localmente sin sobrecargar tu sistema.

- Para usar un modelo local o en la nube como asistente de desarrollo, puedes integrarlo en **Claude Code**.
- Al iniciar Claude Code, selecciona el modelo deseado (como Gemma 4 en la nube) del catálogo de Ollama.
- Envía tu solicitud y el modelo creará código o generará archivos (por ejemplo, presentaciones HTML o páginas web) en tu directorio de trabajo.