gotburnout

LLM Locales y Gemma 4: Guía Completa

Una guía detallada sobre cómo funcionan las redes neuronales locales, qué son HuggingFace y Ollama, y cómo ejecutar el potente modelo Gemma 4 incluso en una computadora normal.

Ver video original

¿Qué son los modelos locales y por qué son populares?

Actualmente, los modelos locales se están poniendo al día muy rápidamente con sus contrapartes cerradas más grandes. Por ejemplo, Gemma 4 rinde aproximadamente al nivel de GPT-4O Mini.

  • Privacidad: Tus datos nunca salen de tu computadora.
  • Acceso sin conexión: El modelo funciona incluso sin internet.
  • Flexibilidad: Posibilidad de ajuste fino (fine-tuning) para tareas específicas (redacción de textos, código, medicina).

1 ¿Por qué deberías prestar atención a Gemma 4?

Google lanzó toda una familia de modelos Gemma 4 que tienen una serie de ventajas significativas:

  • Dos modelos pequeños (2.4B parámetros): Ideales para teléfonos, dispositivos pequeños (por ejemplo, Raspberry Pi).
  • Dos modelos grandes (26B y 31B parámetros): Diseñados para computadoras potentes. Para sus parámetros, muestran benchmarks más altos que algunos modelos de 100 mil millones (como DeepSeek V3).
  • Capacidades de agente (Tool Calling): El modelo puede llamar a funciones y crear sistemas de agentes completos.
  • Multimodalidad: Gemma 4 puede reconocer audio e imágenes, así como generarlos.
  • Licencia abierta (Apache 2): A diferencia de versiones anteriores, puedes usarlo con fines comerciales sin restricciones.

2 HuggingFace: Mercado de Modelos

HuggingFace es el mercado más grande para modelos de IA locales (también llamado el acelerador o GitHub para aprendizaje automático).

Cuando buscas un modelo allí, los nombres de los archivos pueden parecer intimidantes. Analicémoslos usando Unsloth/Gemma4-24B-A4BIT-IT-GGUF como ejemplo:

  1. Unsloth: El autor u organización que optimizó y subió el modelo.
  2. Gemma 4: El nombre del modelo en sí.
  3. 24B: Número de parámetros (24 mil millones).
  4. A4BIT: De 24 mil millones de parámetros, solo se usan activamente 4 mil millones.
  5. IT (Instruction Tuned): El parámetro más importante. Significa que el modelo está entrenado como un chat, es decir, entiende instrucciones y mantiene un diálogo (en lugar de simplemente continuar texto).
  6. GGUF: Formato de archivo optimizado para ejecución local a través de Ollama o LM Studio.

3 Fine-tuning y Cuantización

Para ejecutar modelos grandes en computadoras domésticas, se utilizan dos enfoques:

Ajuste Fino (Fine-Tuning)

Este es el proceso de entrenar un modelo base para tareas específicas (medicina, programación, finanzas). En lugar de saber un poco de todo, el modelo se convierte en un experto en un campo estrecho.

Cuantización (Quantization)

Esto es "comprimir" el modelo reduciendo la precisión de los números (por ejemplo, de 16 bits a 4 bits). Debido a esto, un modelo que inicialmente pesa 15 GB se puede comprimir a 5 GB, lo que le permite ejecutarse en computadoras con menos RAM.

En HuggingFace, puedes verificar la compatibilidad de la cuantización seleccionada con tu computadora agregando tus parámetros de hardware (por ejemplo, Mac M4 Max) en la sección correspondiente en la página del modelo.

4 Instalación y Uso de Ollama

Ollama es una de las aplicaciones más fáciles para administrar modelos locales.

1. Ve al sitio web de Ollama y descarga la versión de escritorio (para macOS, Windows o Linux).

2. Después de la instalación, crea una cuenta en su sitio web.

3. Para descargar un modelo de HuggingFace, copia el comando de inicio (por ejemplo, ollama run...) desde la página del modelo.

4. Abre la terminal y pega este comando. Espera a que termine la descarga.

5. Después de eso, puedes chatear con el modelo directamente en la aplicación Ollama o vía terminal (las respuestas se generan rápidamente: aproximadamente de 6 a 8 segundos para preguntas simples).

Nota: Al trabajar incluso con un modelo pequeño (4B) localmente, tu computadora portátil usará los recursos máximos (los ventiladores pueden comenzar a funcionar a plena capacidad).

5 Integración en la Nube y Claude Code

Si tu computadora no puede manejar modelos pesados, Ollama tiene una excelente alternativa en la nube. Puedes conectar la versión en la nube de la pesada Gemma 4 (31B parámetros) y trabajar con ella localmente sin cargar tu sistema.

  • Para utilizar un modelo local o en la nube como asistente de desarrollador de IA, puedes integrarlos en Claude Code.
  • Al ejecutar Claude Code, selecciona el modelo requerido (por ejemplo, Gemma 4 en la nube) de la lista de Ollama.
  • Haz una solicitud y el modelo escribirá código o creará un archivo (por ejemplo, una presentación HTML o una página web) directamente en la carpeta de tu proyecto.
Los límites de uso gratuito en la nube en Ollama Cloud son bastante generosos (se actualizan cada 2 horas y 3 días), por lo que la creación de proyectos pequeños tomará solo fracciones de un por ciento de tus límites.