A quién sirve — A quien transforma palabras (noticias, 10-K, transcripts) en números para modelos o dashboards. El NLP es el motor detrás de gran parte del sentiment moderno.
El NLP (Natural Language Processing) en finanzas aplica técnicas lingüísticas a documentos de mercado — tokenización, entity recognition (ticker, CEO), clasificación de sentiment, topic modeling, summarization con LLM — para extraer señal de flujos textuales de alta frecuencia.
En palabras sencillas — Enseñar al ordenador a «leer» titulares e informes como haría un analista — pero a escala y con reglas explícitas.
Pipeline típica
| Paso | Output |
|---|---|
| Ingest y deduplica | Stream limpio, timestamp UTC |
| Normalización | Lemas, eliminación de boilerplate |
| Scoring | Polaridad (−1…+1), urgency, novelty |
| Agregación | Por ticker, sector, ventana temporal |
| Feature | Input para modelos con lag |
Los léxicos específicos de finanzas (Loughran-McDonald) superan a los diccionarios genéricos en filings y noticias corporativas. Los LLM ayudan en summarization pero requieren control de alucinaciones y coste.
Riesgos
- Look-ahead: timestamp de la noticia vs disponibilidad real (retraso del wire)
- Survivorship: solo valores con cobertura mediática
- Overfitting sobre un corpus pequeño
- Régimen: el lenguaje bear difiere del bull — un modelo estático degrada
Error típico — Sentiment con LLM sobre titulares sin verificar el timestamp de publicación — data leakage en el backtest.
Ejemplo — Earnings call: el NLP extrae el tono sobre «guidance» y «margin» → score agregado en T+1 como feature para un modelo direccional semanal.
Ficha
- Output: score, tema, entidades.
- Valida con: correlación out-of-sample con el retorno.
- Hub: IA y mercados.