# Novedades de ElevenLabs: guía completa de nuevas herramientas y control de voz

> Guía completa de generación de voz en ElevenLabs: modelos (v3, Multilingual v2, Flash, Turbo), etiquetas de audio de entonación, fonemas IPA/Arpabet, diccionarios PLS y normalización de texto.

Las últimas actualizaciones de la plataforma ElevenLabs han expandido de manera extraordinaria las capacidades de la síntesis neuronal de voz humana. Los desarrolladores cuentan ahora con una gama diferenciada de modelos: desde el hiperrealista Eleven v3 con modulación emocional profunda hasta variantes ultrarrápidas como Flash y Turbo orientadas a flujos conversacionales en tiempo real.

En esta guía práctica se analizan todas las herramientas clave: selección de arquitectura, uso de etiquetas de audio expresivas, control de cadencia mediante SSML, gestión de pronunciaciones corporativas con diccionarios PLS y la imprescindible normalización previa de texto antes de la llamada a la API.

---

## 1. Descripción general de los modelos de ElevenLabs

El ecosistema actual de ElevenLabs ofrece cuatro modelos principales adaptados a diversos requisitos de ingeniería.

### 1.1. Características arquitectónicas y especialización de modelos

- **Eleven v3 (alpha):** Modelo insignia con la máxima fidelidad acústica y naturalidad interpretativa. Admite etiquetas de audio integradas para proyectar estados emocionales (alegría, tristeza, susurros, gritos, suspiros). Está especialmente optimizado para contenidos en inglés y rinde mejor con textos extensos y ricos en contexto narrativo.
- **Multilingual v2:** El estándar de referencia corporativo para proyectos internacionales. Es compatible con más de 30 idiomas con una precisión fonética sobresaliente en diversos alfabetos y signos diacríticos. Ofrece una estabilidad excepcional, aunque con un rango dramático más contenido que v3.
- **Flash v2.5:** Modelo de alta velocidad con latencia reducida (~75 ms) y un límite de 5.000 caracteres por petición. Representa el equilibrio óptimo entre calidad acústica y agilidad para asistentes interactivos.
- **Turbo v2.5:** Diseñado para minimizar la latencia al extremo (~50 ms) en sistemas de telefonía (IVR) o doblaje simultáneo en streaming, priorizando la inmediatez sobre los micro-matices tímbricos.

### 1.2. Tabla comparativa consolidada de especificaciones

| Modelo | Calidad vocal y expresividad | Latencia de generación | Cobertura lingüística | Límite de caracteres | Aplicaciones recomendadas |
| :--- | :--- | :--- | :--- | :--- | :--- |
| **Eleven v3 (alpha)** | Máxima, realismo cinematográfico | Moderada | Optimizado para inglés | 15.000 | Audiolibros, doblaje cinematográfico, diálogos de ficción |
| **Multilingual v2** | Alta, muy estable | Media | Más de 30 idiomas | 15.000 | Localización global, e-learning, contenidos corporativos |
| **Flash v2.5** | Buena (equilibrada) | Muy baja (~75 ms) | Inglés, multilingüe parcial | 5.000 | Chatbots de voz, NPCs en videojuegos, traducción en vivo |
| **Turbo v2.5** | Funcional utilitaria | Mínima (~50 ms) | Conjunto básico de idiomas | 5.000 | Sistemas de telefonía IVR, alertas y avisos urgentes |

---

## 2. Criterios de selección de modelos según el escenario

Elegir el modelo adecuado exige sopesar la latencia tolerable, el consumo de créditos y las expectativas expresivas.

### 2.1. Locución creativa frente a streaming en tiempo real

:::tabs
=== Narrativa creativa (v3)
Para audiolibros dramáticos, cuñas publicitarias o locución de personajes teatrales, elija **Eleven v3**. Es capaz de introducir pausas dramáticas, respiraciones, risas y transiciones de ánimo fluidas en un solo párrafo, imitando fielmente a un actor de doblaje en estudio.
=== Localización global (Multilingual v2)
Si su iniciativa requiere distribución internacional con pronunciación uniforme en español y otros idiomas, la elección obligada es **Multilingual v2**. Procesa con solvencia acentos, grafías especiales y cambios de idioma.
=== Tiempo real y voz conversacional (Flash / Turbo)
Para interfaces conversacionales, bots telefónicos o personajes interactivos, despliegue **Flash v2.5** o **Turbo v2.5**. Suprimirán los silencios incómodos entre la intervención del usuario y la respuesta sintetizada.
:::

### 2.2. Localización multilingüe y síntesis de baja latencia

> [!TIP]
> En aplicaciones a gran escala resulta muy eficiente implementar una arquitectura híbrida: generar saludos inmediatos con **Flash v2.5** y sintetizar explicaciones detalladas con **Multilingual v2**.

---

## 3. Gestión de la entonación, emociones y etiquetas de audio

Una de las ventajas determinantes de las versiones recientes de ElevenLabs es la capacidad de dirigir la interpretación mediante etiquetas de audio intercaladas en el texto.

### 3.1. Etiquetas de audio de Eleven v3 y modificadores expresivos

El modelo Eleven v3 reconoce etiquetas en formato XML que actúan como anotaciones de dirección para el locutor:

- **Modificadores emocionales:** `<happy>`, `<sad>`, `<angry>`, `<excited>`, `<calm>`, `<sarcastic>`.
- **Efectos físicos y vocalizaciones:** `<laugh>`, `<sigh>`, `<cough>`, `<gasp>`, `<whisper>`, `<shout>`.
- **Dinámica interpretativa:** Envolver oraciones específicas permite modular el estado anímico sobre la marcha.

### 3.2. El papel de la puntuación, mayúsculas y fraseo

Además de las etiquetas formales, el modelo analiza minuciosamente la ortografía tradicional:
- **Punto (`.`):** Introduce una pausa clara acompañada de una entonación declarativa descendente.
- **Coma (`,`):** Provoca un breve respiro rítmico que conserva la expectativa melódica.
- **Puntos suspensivos (`...`) o guion largo (`—`):** Aportan una vacilación o reflexión espontánea propia del habla natural.
- **MAYÚSCULAS:** Indican al sintetizador que debe enfatizar la palabra aumentando el volumen y la intensidad vocal.

---

## 4. Ejemplos prácticos de entonación y diálogos

Analicemos cómo estructurar adecuadamente las indicaciones textuales para asegurar resultados homogéneos.

### 4.1. Escenarios de monólogo, diálogo y transiciones emocionales

> 💡 **Ejemplo de monólogo con etiquetas expresivas:**
```text
<laugh> It’s funny how life works sometimes. You think you’ve planned everything perfectly... but then <sigh> something unexpected happens.
```
*Resultado: La voz comienza con una risa breve y espontánea, hace una pausa meditativa en los puntos suspensivos y suspira suavemente antes de continuar.*

> 💡 **Ejemplo de diálogo dramático entre dos personajes:**
```text
<angry> "I told you never to open that door!" </angry>
<calm> "I know, but you don't understand what was inside..." </calm>
```
*Resultado: La primera intervención suena enérgica y autoritaria, mientras que la réplica adopta un tono reposado y tranquilizador.*

### 4.2. Recomendaciones: estabilidad, selección de voz y equilibrio de etiquetas

1. **Extensión del contexto:** Evite indicaciones de 1 o 2 palabras. Aporte frases de al menos 10 palabras para dotar al modelo de contexto entonativo suficiente.
2. **Respuesta acústica de la voz:** No todas las voces clonadas procesan con la misma pericia etiquetas extremas como `<shout>` o `<whisper>`. Pruebe el fragmento con 2 o 3 voces de VoiceLab.
3. **Contención:** Limite el uso a un máximo de tres etiquetas por oración para evitar artefactos o modulaciones artificiales.

---

## 5. Control de tempo, pausas y velocidad de locución

Sincronizar la locución generada con montajes de vídeo o interfaces gráficas requiere un control riguroso de tiempos.

### 5.1. Etiquetas SSML de pausa y retrasos por puntuación

Para insertar silencios con precisión milimétrica, emplee la etiqueta SSML correspondiente:

```xml
Hello there <break time="1.5s" /> welcome to our system.
```

- Admite valores en segundos (`1.5s`) o en milisegundos (`500ms`).
- La duración recomendada para pausas naturales oscila entre `0.1s` y `3.0s`.

### 5.2. Parámetro de velocidad de habla (speed) en la API

La velocidad se modula programáticamente mediante el parámetro `speed`:
- `1.0` — Velocidad nominal estándar del locutor seleccionado.
- `0.8` — Cadencia pausada, idónea para lecciones formativas o meditaciones guiadas.
- `1.2` — Ritmo enérgico y dinámico para promociones comerciales y resúmenes de actualidad.
- Rango operativo válido: de `0.5` a `2.0`.

---

## 6. Control de pronunciación: fonemas, etiquetas alias y diccionarios PLS

Ante términos médicos complejos, marcas comerciales o tecnicismos poco habituales, las reglas fonéticas garantizan una pronunciación impecable.

### 6.1. Marcado fonético (IPA / CMU Arpabet) y etiquetas alias

La etiqueta `<phoneme>` permite definir la transcripción exacta según el Alfabeto Fonético Internacional (IPA):

```xml
<phoneme alphabet="ipa" ph="həˈləʊ">hello</phoneme>
```

Para acrónimos o términos abreviados frecuentes, la etiqueta `<alias>` resuelve la lectura de forma inmediata:

```xml
<alias text="laugh out loud">LOL</alias>
```
*El sistema pronunciará la frase completa en lugar del deletreo letra por letra.*

### 6.2. Diccionarios corporativos de pronunciación (PLS)

Para despliegues a gran escala, ElevenLabs admite el estándar **Pronunciation Lexicon Specification (PLS)**. Es posible cargar un archivo XML con el glosario corporativo en los ajustes del Workspace para asegurar que todas las voces pronuncien las marcas y referencias de forma canónica.

### 6.3. Enfoque contextual y articulación en diálogos

> [!NOTE]
> Si prefiere evitar el marcado XML, recurra a la transcripción fonética directa en el propio texto: separe silábicamente las palabras difíciles (por ejemplo, *"Ne-o-bank"* en lugar de *"Neobank"*).

---

## 7. Normalización de texto: números, fechas, monedas y abreviaturas

Los motores neuronales sintetizan caracteres de manera secuencial. Remitir textos sin normalizar provoca lecturas equívocas, como pronunciar `11/05` como «once barra cero cinco».

### 7.1. Por qué los modelos fallan con datos numéricos en bruto

Los sintetizadores carecen de telepatía contextual: no pueden deducir si la cifra `1984` alude a un año, un precio en euros, un código de seguridad o un número de portal.

### 7.2. Tres métodos de normalización: modelo, prompting y RegEx

1. **Elección del modelo:** Multilingual v2 incorpora reglas nativas de resolución numérica más depuradas que la versión v3.
2. **Verbalización directa:** Escriba los valores con palabras en el propio texto de origen.
3. **Preprocesamiento por software (RegEx):** Implemente filtros con expresiones regulares que transformen símbolos de moneda y fechas antes de llamar a la API.

### 7.3. Tabla de referencia de normalización de datos

| Categoría | Entrada sin procesar | Texto normalizado para API |
| :--- | :--- | :--- |
| **Teléfono** | `+34 91 123 45 67` | `más tres cuatro, nueve uno, uno dos tres, cuatro cinco, seis siete` |
| **Fecha** | `24/08/2026` | `veinticuatro de agosto de dos mil veintiséis` |
| **Moneda** | `250 €` | `doscientos cincuenta euros` |
| **Intervalo** | `10-15 kg` | `de diez a quince kilogramos` |
| **Siglas** | `OTAN` | `OTAN` (como palabra) o `C-E-O` (con guiones si debe deletrearse) |

---

## 8. Integración mediante API y ejemplos de código

Para lograr una síntesis fiable en servidores de producción, envíe siempre texto pre-normalizado especificando la configuración de estabilidad vocal.

### 8.1. Estructuración de peticiones con texto pre-normalizado

> [!IMPORTANT]
> Los parámetros `stability` y `similarity_boost` calibran la expresividad: un valor de estabilidad de `0.5` aporta una interpretación cálida y matizada, mientras que `0.8` proporciona una locución sobria y formal tipo telediario.

### 8.2. Muestras de código en Python, TypeScript y cURL

:::tabs
=== Python SDK
```python
import requests

url = "https://api.elevenlabs.io/v1/text-to-speech/21m00Tcm4TlvDq8ikWAM"
headers = {
    "xi-api-key": "YOUR_API_KEY",
    "Content-Type": "application/json"
}
data = {
    "text": "El veinticuatro de agosto tendrá lugar la presentación del sistema renovado.",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
        "stability": 0.5,
        "similarity_boost": 0.8,
        "speed": 1.0
    }
}

response = requests.post(url, headers=headers, json=data)
with open("output.mp3", "wb") as f:
    f.write(response.content)
```
=== TypeScript (Node.js)
```typescript
import fs from "fs";

const voiceId = "21m00Tcm4TlvDq8ikWAM";
const url = `https://api.elevenlabs.io/v1/text-to-speech/${voiceId}`;

const payload = {
  text: "El veinticuatro de agosto tendrá lugar la presentación del sistema renovado.",
  model_id: "eleven_multilingual_v2",
  voice_settings: {
    stability: 0.5,
    similarity_boost: 0.8,
    speed: 1.0
  }
};

async function generateSpeech() {
  const response = await fetch(url, {
    method: "POST",
    headers: {
      "xi-api-key": process.env.ELEVENLABS_API_KEY || "",
      "Content-Type": "application/json"
    },
    body: JSON.stringify(payload)
  });

  const arrayBuffer = await response.arrayBuffer();
  fs.writeFileSync("output.mp3", Buffer.from(arrayBuffer));
}

generateSpeech();
```
=== cURL (Bash)
```bash
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/21m00Tcm4TlvDq8ikWAM" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hello! Welcome to the new ElevenLabs voice synthesis platform.",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
      "stability": 0.5,
      "similarity_boost": 0.8
    }
  }' \
  --output output.mp3
```
:::