Saltar al contenido

NLP en finanzas

Elaboración del lenguaje natural en textos financieros — news, filing, call; base para sentiment y feature ML.

En esta página

A quién sirve — A quien transforma palabras (noticias, 10-K, transcripts) en números para modelos o dashboards. El NLP es el motor detrás de gran parte del sentiment moderno.

El NLP (Natural Language Processing) en finanzas aplica técnicas lingüísticas a documentos de mercado — tokenización, entity recognition (ticker, CEO), clasificación de sentiment, topic modeling, summarization con LLM — para extraer señal de flujos textuales de alta frecuencia.

En palabras sencillas — Enseñar al ordenador a «leer» titulares e informes como haría un analista — pero a escala y con reglas explícitas.


Pipeline típica

Paso Output
Ingest y deduplica Stream limpio, timestamp UTC
Normalización Lemas, eliminación de boilerplate
Scoring Polaridad (−1…+1), urgency, novelty
Agregación Por ticker, sector, ventana temporal
Feature Input para modelos con lag

Los léxicos específicos de finanzas (Loughran-McDonald) superan a los diccionarios genéricos en filings y noticias corporativas. Los LLM ayudan en summarization pero requieren control de alucinaciones y coste.


Riesgos

  • Look-ahead: timestamp de la noticia vs disponibilidad real (retraso del wire)
  • Survivorship: solo valores con cobertura mediática
  • Overfitting sobre un corpus pequeño
  • Régimen: el lenguaje bear difiere del bull — un modelo estático degrada

Error típico — Sentiment con LLM sobre titulares sin verificar el timestamp de publicación — data leakage en el backtest.

Ejemplo — Earnings call: el NLP extrae el tono sobre «guidance» y «margin» → score agregado en T+1 como feature para un modelo direccional semanal.

Ficha

  • Output: score, tema, entidades.
  • Valida con: correlación out-of-sample con el retorno.
  • Hub: IA y mercados.

Enlaces