← Back to list

Pre-Training: cómo los Large Language Models aprenden el lenguaje natural

Los Large Language Models (LLM) que utilizamos como asistentes en nuestro día a día han aprendido a comunicarse con nosotros gracias al…

Daniel Parres Montoya in Cognizant AI & Analytics Spain · 2025-11-12 07:20 · 0 claps · 4.6 min read
#large-language-models #pre-training #reinforcement-learning #llm #lenguaje-natural
Open on Medium ↗
Wiki topics: LLM · Large Language Models EDU · Education & Learning

Pre-Training: cómo los Large Language Models aprenden el lenguaje natural

Los Large Language Models (LLM) que utilizamos como asistentes en nuestro día a día han aprendido a comunicarse con nosotros gracias al entrenamiento utilizando grandes volúmenes de datos. El objetivo del entrenamiento es dotar al modelo de la capacidad para generar texto de forma coherente y útil para el usuario. Este proceso suele dividirse en dos etapas: Pre-Training y Post-Training, las cuales ya hablamos en un artículo anterior [1].

En este artículo nos enfocaremos en la fase de Pre-Training, el proceso que dota a los LLMs de la capacidad para comprender y generar lenguaje natural. Comenzaremos explicando el funcionamiento interno de estos modelos, analizaremos el enfoque tradicional de Pre-Training utilizado en sistemas como ChatGPT [2] y, por último, exploraremos nuevas estrategias emergentes.

Los LLMs interactúan con nosotros imitando nuestra forma de comunicarnos: a partir del texto previo, predicen cuál será la siguiente palabra más probable, como se presenta en la Figura 1. Los modelos que emplean esta técnica se denominan autorregresivos y su mecanismo se basa en predecir la siguiente palabra teniendo en cuenta tres factores principales: el texto que el propio modelo ha generado anteriormente, el contexto de la conversación y el conocimiento adquirido durante el entrenamiento.

Figura 1. Ejemplo del mecanismo de autorregresión de un LLM.

Figura 1. Ejemplo del mecanismo de autorregresión de un LLM.

Desde un punto de vista técnico, los LLMs no siempre generan texto palabra por palabra. Algunos modelos trabajan carácter a carácter, otros utilizan fragmentos de palabras llamados subwords e, incluso, existen variantes que operan a nivel de byte [3]. Para englobar esta diversidad en la unidad de generación, se utiliza el término token, que representa cualquiera de estos elementos según el diseño del modelo.

Después de haber explicado el funcionamiento interno de los LLMs y su mecanismo autorregresivo, el siguiente paso es analizar las distintas estrategias de Pre-Training que hacen posible que estos modelos aprendan y dominen la gramática, la sintaxis y la semántica del lenguaje natural.

Enfoque tradicional: Causal Language Modeling

Los LLMs actuales, utilizan como estrategia de Pre-Training estándar el enfoque conocido como Causal Language Modeling (CLM) [4]. Esta técnica se basa en predecir el siguiente token dentro de una secuencia de palabras, considerando únicamente el texto previo. Para esta fase de entrenamiento, se emplean grandes volúmenes de datos extraídos de diversas fuentes como artículos de Internet, publicaciones en redes sociales, libros e incluso código. Este enfoque ha demostrado ser altamente eficaz para que el modelo aprenda a generar texto coherente, y es utilizado en asistentes como ChatGPT [2], Gemini [5], Llama [6] y DeepSeek [7].

Nuevos enfoques

Existe una amplia variedad de estrategias de Pre-Training que se basan en la estrategia CLM, las más llamativas son las tres siguientes.

Pares instrucción-respuesta

En la propia fase de Pre-Training, se puede enriquecer el entrenamiento añadiendo pares de instrucción-respuesta. Estos pares pueden abarcar tareas como resumir un texto, clasificación de documentos, análisis de sentimientos o preguntas y respuestas.

Cuando se incluyen estos pares durante el Pre-Training, se sigue utilizando la estrategia CLM. Es decir, el modelo continúa prediciendo el siguiente token, pero simulando la interacción instrucción-respuesta. Con esta estrategia, el modelo aprende implícitamente a resolver tareas mientras sigue adquiriendo el conocimiento sobre la estructura del lenguaje natural.

Pre-Training adaptativo

El enfoque Pre-Training adaptativo consiste en organizar los datos de entrenamiento de forma gradual, comenzando con textos simples y aumentando progresivamente la complejidad, para adaptar y orientar el modelo hacia el contexto deseado. Por este motivo, resulta interesante dividir esta fase en múltiples subetapas.

Por ejemplo, si el objetivo es entrenar un LLM para generar informes médicos, se utilizaría un enfoque progresivo: se empezaría con un texto general para que el modelo aprenda la estructura básica del lenguaje, luego se incorporarían documentos técnicos con terminología médica y, finalmente, se incorporarían informes clínicos y casos reales para especializarlo en su dominio.

Reinforcement Pre-Training

El Reinforcement Pre-Training (RPT) es una técnica nueva de Microsoft [8] que cambia la forma en que se entrenan los LLMs. En lugar de solo revisar si el modelo acierta o falla al predecir el siguiente token, el RPT convierte al LLM en un agente que debe razonar cuál es la mejor opción. Dependiendo de si su elección es buena o no, recibe una recompensa o un castigo. Este método, basado en el aprendizaje por refuerzo, ayuda al modelo a razonar mejor y tomar decisiones más claras antes de dar su respuesta final.

Conclusión

Existe una amplia variedad de estrategias de Pre-Training, aunque la mayoría se inspiran en el enfoque CLM, que consiste en predecir el siguiente token de de una secuencia de palabras. Este método permite a los LLMs adquirir una comprensión profunda de la estructura del lenguaje natural. Dada la relevancia del Pre-Training y el creciente interés por aprovechar al máximo grandes volúmenes de datos, este campo se encuentra en constante evolución. En próximas entregas seguiremos profundizando y compartiendo novedades sobre el entrenamiento de LLMs.

En Cognizant, conocemos en profundidad la naturaleza de los LLMs. Nuestra experiencia en automatización, IA aplicada y servicios de datos para entrenamiento de modelos nos posiciona como socio estratégico para empresas que buscan aprovechar el potencial de los LLMs. Descubre nuestro trabajo y contacta con el equipo aquí.

Referencias

[1] Parres, D. (2025). Del dato al asistente: cómo se entrenan los Large Language Models. Medium. https://medium.com/cognizant-ai-data-spain/del-dato-al-asistente-c%C3%B3mo-se-entrenan-los-large-language-models-0dc56ba4c23e

[2] OpenAI. (2025). ChatGPT.

[3] Pagnoni, A., Pasunuru, R., Rodriguez, P., Nguyen, J., Muller, B., Li, M., Zhou, C., Yu, L., Weston, J., Zettlemoyer, L., Ghosh, G., Lewis, M., Holtzman, A., & Iyer, S. (2024). Byte Latent Transformer: Patches Scale Better Than Tokens. arXiv. https://arxiv.org/abs/2412.09871

[4] Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving language understanding by generative pre-training. OpenAI. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf

[5] Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Amodei, D., Anthropic, Ariely, D., Arisdakessian, V., Askell, A., Bai, Y., Balaji, S., Balcan, G., Bartolo, M., Bauer, R., … & Zhu, Y. (2023). Gemini: A family of highly capable multimodal models. arXiv. https://arxiv.org/abs/2312.11805

[6] Grattafiori, A., Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., … & Jia, J. (2024). The Llama 3 Herd of Models. arXiv. https://arxiv.org/abs/2407.21783

[7] Bi, X., Chen, D., Chen, G., Chen, S., Dai, D., Deng, C., Ding, H., Dong, K., Du, Q., Fu, Z., & others. (2024). DeepSeek LLM: Scaling open-source language models with longtermism [Preprint]. arXiv. https://arxiv.org/abs/2401.02954

[8] Dong Q., Dong L., Tang Y., Ye T., Sun Y., Sui Z. & Wei F. (2025). Reinforcement Pre-Training. arXiv. https://arxiv.org/abs/2506.08007


메타데이터
post_id
db09c7bd2df7
slug
pre-training-cómo-los-large-language-models-aprenden-el-lenguaje-natural-db09c7bd2df7
url
https://medium.com/cognizant-ai-data-spain/pre-training-c%C3%B3mo-los-large-language-models-aprenden-el-lenguaje-natural-db09c7bd2df7
canonical_url
https://medium.com/cognizant-ai-data-spain/pre-training-c%C3%B3mo-los-large-language-models-aprenden-el-lenguaje-natural-db09c7bd2df7
author_url
https://medium.com/@daniel.parresmontoya
status
ok
fetched_at
2026-06-15 20:49:13