Diccionario del
Marketing Digital

Reinforcement Learning: Qué es, Cómo Funciona el Aprendizaje por Refuerzo y Ejemplos

El aprendizaje por refuerzo (Reinforcement Learning) es una rama del machine learning en la que un agente aprende a tomar decisiones mediante la interacción con un entorno. En lugar de recibir para cada ejemplo una respuesta exacta que debe imitar, ejecuta acciones, observa sus consecuencias y ajusta su comportamiento para obtener mejores recompensas a lo largo del tiempo.

Este enfoque resulta especialmente útil cuando una decisión modifica lo que sucederá después. Un robot debe aprender a desplazarse sin caer, un sistema logístico puede decidir cómo asignar recursos y un modelo de lenguaje puede mejorar determinados comportamientos mediante señales de recompensa.

La dificultad no consiste únicamente en elegir la acción con mejor resultado inmediato. Muchas tareas exigen sacrificar una recompensa pequeña en el presente para conseguir un resultado mayor en el futuro. También obligan a explorar alternativas desconocidas sin abandonar por completo las acciones que ya funcionan.

En Aula CM explicamos el aprendizaje por refuerzo como un sistema de decisión secuencial. El modelo no se limita a predecir una categoría. Aprende una estrategia para actuar dentro de un proceso donde cada decisión puede cambiar el siguiente estado, las opciones disponibles y las recompensas futuras.

Esta diferencia resulta esencial para no aplicar reinforcement learning a cualquier problema de inteligencia artificial. Si solo necesitamos clasificar imágenes, estimar una venta o predecir el abandono a partir de ejemplos históricos, probablemente debamos comenzar con aprendizaje supervisado. El refuerzo adquiere sentido cuando existen acciones, consecuencias, una secuencia temporal y un objetivo acumulado.

Qué es el aprendizaje por refuerzo

El aprendizaje por refuerzo, también denominado reinforcement learning o RL, es un paradigma en el que un agente aprende una política de actuación mediante prueba, observación y ajuste.

El agente recibe información sobre la situación actual, elige una acción y obtiene una nueva observación junto con una recompensa. Al repetir este ciclo, intenta descubrir qué comportamiento maximiza la suma de recompensas futuras.

Imaginemos un sistema que gestiona la temperatura de un edificio. Puede aumentar, reducir o mantener la climatización. Cada acción afecta al confort, al consumo energético y al estado posterior. El objetivo no consiste en acertar una etiqueta, sino en controlar el sistema durante un periodo completo.

Una definición profesional debe incluir cuatro ideas:

  • Existe un agente que toma decisiones.
  • Existe un entorno donde esas decisiones producen consecuencias.
  • Existe una señal de recompensa que representa el objetivo.
  • Existe una secuencia temporal donde las acciones actuales afectan a resultados futuros.

El aprendizaje puede producirse dentro de un simulador, mediante datos previamente registrados o a través de interacción directa. Esta última opción exige especial cuidado cuando una mala decisión puede causar pérdidas, daños o una mala experiencia.

Qué significa reinforcement learning

Reinforcement learning significa aprendizaje por refuerzo. La expresión procede de la idea de reforzar comportamientos mediante las consecuencias que producen.

En inteligencia artificial, el término se utiliza de una forma matemática y operativa. La recompensa no necesita representar placer, aprobación o castigo. Puede ser simplemente un número utilizado para orientar la optimización.

Por ejemplo, un sistema puede recibir una recompensa positiva por completar una tarea, una penalización por consumir demasiados recursos y una recompensa adicional por hacerlo dentro de un tiempo determinado.

El agente no interpreta estos números como lo haría una persona. Ajusta su política según las relaciones observadas entre situaciones, acciones y resultados.

La traducción “aprendizaje por refuerzo” puede generar confusión con conceptos de psicología conductista. Ambos ámbitos comparten vocabulario, pero no son equivalentes. En machine learning hablamos de un marco computacional para optimizar decisiones secuenciales.

Cuál es el objetivo del aprendizaje por refuerzo

El objetivo consiste en aprender una política que maximice la recompensa acumulada esperada.

La palabra “acumulada” resulta importante. Una acción puede generar una buena recompensa inmediata y perjudicar el resultado final. Otra puede parecer poco atractiva al principio y permitir alcanzar un estado mucho mejor posteriormente.

Un agente que juega al ajedrez no debería valorar únicamente la captura inmediata de una pieza. Debe considerar cómo esa acción afecta a las posibilidades de ganar. Un sistema de recomendación no debería optimizar exclusivamente el clic si eso reduce la satisfacción, la diversidad o la retención.

Por tanto, el objetivo real depende de cómo se construye la recompensa. El algoritmo optimizará la señal que recibe, no necesariamente la intención que tenía la empresa.

Esta diferencia explica muchos fallos. Si premiamos el tiempo de permanencia, el sistema puede aprender a prolongarlo sin mejorar la experiencia. Si premiamos el número de pedidos, puede favorecer descuentos que destruyen margen. Diseñar la recompensa es una decisión de producto y negocio, no solo una tarea matemática.

Cómo funciona el aprendizaje por refuerzo

El funcionamiento básico se desarrolla mediante un bucle de interacción.

  • El entorno presenta un estado u observación.
  • El agente selecciona una acción.
  • El entorno cambia como consecuencia de la acción.
  • El agente recibe una recompensa.
  • El proceso continúa desde el nuevo estado.

Durante las primeras interacciones, el comportamiento puede ser poco eficaz. El agente necesita explorar y recopilar experiencia. Con el tiempo, utiliza esa información para estimar qué acciones producen mejores resultados.

El aprendizaje puede apoyarse en una tabla, una función matemática, árboles, redes neuronales u otros modelos. Cuando utiliza redes profundas para representar políticas o funciones de valor, hablamos de aprendizaje por refuerzo profundo.

El agente tampoco necesita recibir una recompensa después de cada acción. En algunos problemas solo conoce el resultado al final. Esta demora dificulta descubrir qué decisiones contribuyeron realmente al éxito o al fracaso.

Cuando trabajamos este tipo de casos, recomendamos separar la interacción, el aprendizaje y la evaluación. Un sistema puede generar experiencia con una política, utilizarla para actualizar el modelo y después probar la nueva versión en condiciones controladas.

Elementos del aprendizaje por refuerzo

Los principales elementos son el agente, el entorno, los estados, las observaciones, las acciones, las recompensas, la política y las funciones de valor.

Agente

Es la entidad que toma decisiones. Puede ser un robot, un programa, un sistema de control, una red neuronal o un componente de un producto digital.

Entorno

Es el sistema con el que interactúa el agente. Define qué consecuencias producen las acciones y qué información recibe el modelo.

Estado

Representa la situación relevante del entorno en un momento determinado. Idealmente contiene la información necesaria para anticipar cómo evolucionará el sistema.

Observación

Es la información que el agente puede percibir. Puede coincidir con el estado completo o mostrar únicamente una parte.

Acción

Es una decisión disponible para el agente. Puede ser discreta, como elegir entre varias opciones, o continua, como aplicar una intensidad determinada.

Recompensa

Es una señal numérica que evalúa la consecuencia de una acción o de una transición.

Política

Es la estrategia que utiliza el agente para seleccionar acciones a partir de estados u observaciones.

Función de valor

Estima cuánta recompensa futura puede obtenerse desde una situación o después de ejecutar una acción.

Modelo del entorno

Describe o predice cómo cambiará el entorno. Algunos algoritmos lo utilizan y otros aprenden sin construirlo explícitamente.

Qué es un agente en el aprendizaje por refuerzo

El agente es el componente que observa, decide y aprende. Su definición debe incluir qué información recibe, qué acciones puede realizar y qué objetivo intenta maximizar.

En un videojuego, el agente puede controlar al personaje. En robótica, controla motores. En gestión de inventario, puede decidir cuánto reponer. En un modelo de lenguaje, puede generar secuencias que después son evaluadas mediante una recompensa.

No deberíamos confundir agente con inteligencia general. Un agente de refuerzo puede estar diseñado para una tarea muy específica y carecer de cualquier capacidad fuera de ella.

También conviene diferenciar el agente del sistema completo. Un producto puede incluir percepción, reglas de seguridad, una política aprendida, validaciones y supervisión. La red neuronal es solo uno de sus componentes.

En proyectos profesionales necesitamos definir sus límites. ¿Qué decisiones puede tomar? ¿Cuándo debe solicitar revisión? ¿Qué acciones están prohibidas? ¿Cómo se detiene si el comportamiento resulta incorrecto?

Qué es el entorno

El entorno contiene todo aquello que afecta al agente y queda fuera de su control directo. Recibe acciones, actualiza la situación y devuelve observaciones y recompensas.

Puede ser una simulación, una aplicación, un mercado, un robot físico, un proceso industrial o una interacción con personas.

El entorno determina la dificultad del problema. Puede ser estable o cambiante, completamente observable o parcial, determinista o probabilístico.

Una simulación permite entrenar a gran velocidad y sin asumir ciertos riesgos. Sin embargo, nunca representa perfectamente la realidad. Un agente puede aprender a aprovechar errores o simplificaciones del simulador y fallar cuando se despliega.

Esta diferencia se conoce como brecha entre simulación y realidad. En robótica, por ejemplo, pequeñas variaciones de fricción, iluminación, sensores o materiales pueden alterar el resultado.

Estados y observaciones

El estado intenta representar la información relevante para tomar una decisión. La observación representa lo que el agente conoce realmente.

En un tablero digital, el agente puede observar el estado completo. En conducción, sus sensores ofrecen una representación incompleta y con ruido. No conoce todas las intenciones de otros vehículos ni puede observar cualquier zona.

Cuando la observación no contiene toda la información necesaria, el agente puede necesitar memoria, una estimación del estado o una arquitectura capaz de procesar secuencias.

La selección de variables es crítica. Un agente que no recibe información importante puede tomar decisiones aparentemente irracionales. Otro que recibe información futura por error puede mostrar un rendimiento irreal durante las pruebas.

En marketing ocurre algo parecido. Si diseñamos una política de ofertas sin incorporar margen, stock o devoluciones, el agente optimizará con una visión incompleta del negocio.

Acciones discretas y continuas

Un espacio de acciones discreto contiene opciones separadas. Un agente puede avanzar, retroceder, esperar o elegir uno de varios mensajes.

Un espacio continuo permite seleccionar valores dentro de un rango. Un robot puede decidir el ángulo de una articulación o un sistema energético puede ajustar una potencia.

La diferencia influye en el algoritmo. Q-learning funciona naturalmente con espacios discretos pequeños, mientras que métodos como DDPG, TD3 o SAC se utilizan en determinados problemas de control continuo.

También debemos revisar si todas las acciones son seguras. En una aplicación real puede ser necesario aplicar restricciones antes de ejecutar una decisión.

Limitar el espacio de acción reduce riesgo y facilita el aprendizaje. Ofrecer miles de decisiones posibles sin estructura puede hacer que la exploración resulte ineficiente.

Qué es la recompensa

La recompensa es la señal que indica al agente qué resultados son deseables. Puede ser positiva, negativa o neutra.

Una recompensa inmediata evalúa una transición concreta. El retorno combina varias recompensas a lo largo del tiempo.

Diseñar una buena recompensa exige traducir un objetivo complejo a una señal que el agente pueda optimizar sin encontrar atajos perjudiciales.

Imaginemos un robot de limpieza premiado únicamente por la cantidad de suciedad recogida. Podría aprender a mover la suciedad y recogerla varias veces. El comportamiento maximizaría la métrica y no cumpliría la intención.

Este fenómeno se relaciona con el reward hacking o manipulación de la recompensa. El agente descubre una estrategia que obtiene puntuación alta mediante una solución no prevista.

En una revisión profesional conviene probar cómo podría explotarse la función de recompensa, qué comportamientos quedan sin medir y qué límites deben imponerse fuera del modelo.

Recompensa inmediata y retorno acumulado

La recompensa representa una consecuencia local. El retorno representa la suma de recompensas desde un momento hasta el final o hasta un horizonte determinado.

El agente suele intentar maximizar el retorno esperado, no cada recompensa de forma independiente.

Para controlar la importancia de recompensas lejanas se utiliza un factor de descuento. Un valor bajo prioriza el futuro cercano. Un valor próximo a uno concede más importancia a consecuencias lejanas.

Esta elección refleja el horizonte de decisión. Un sistema publicitario puede reaccionar a conversiones rápidas y perder información sobre recurrencia. Un sistema de fidelización puede necesitar una perspectiva más amplia.

El descuento también ayuda a mantener los cálculos bajo control en tareas muy largas o continuas.

Qué es una política

La política es la regla o función que utiliza el agente para seleccionar acciones. Puede ser determinista o probabilística.

Una política determinista devuelve una acción concreta para cada estado. Una política estocástica devuelve una distribución de probabilidades.

Las políticas probabilísticas resultan útiles para explorar y para trabajar en entornos donde varias acciones pueden ser razonables.

Una política puede representarse mediante una tabla, una fórmula o una red neuronal. Durante el aprendizaje, sus parámetros se ajustan para mejorar el retorno esperado.

No debemos confundir la política con una política empresarial. En RL, el término tiene un significado técnico: es el comportamiento del agente.

Qué son las funciones de valor

Una función de valor estima la recompensa futura esperada. Permite evaluar situaciones antes de conocer todo lo que ocurrirá después.

La función de valor de estado estima el retorno esperado desde un estado siguiendo una política. La función de valor de acción, conocida como función Q, evalúa una acción concreta dentro de un estado.

Estas estimaciones ayudan a comparar decisiones. Si una acción produce una recompensa pequeña ahora y conduce a un estado valioso, su valor total puede ser elevado.

Los métodos basados en valor aprenden estas funciones y seleccionan acciones a partir de ellas. Q-learning es uno de los ejemplos más conocidos.

La estimación puede ser tabular en problemas pequeños o aproximarse mediante una red neuronal en espacios grandes.

Qué es un episodio

Un episodio es una secuencia completa de interacción desde un estado inicial hasta una condición final.

Una partida, un recorrido o la resolución de una tarea pueden constituir un episodio. El conjunto de estados, acciones y recompensas forma una trayectoria.

No todos los problemas tienen un final natural. Un sistema de control puede funcionar de manera continua. En estos casos se utilizan horizontes, cortes o formulaciones continuas.

La longitud del episodio afecta al aprendizaje. Si es demasiado corta, el agente puede no observar consecuencias lejanas. Si es muy larga, atribuir el resultado a acciones concretas se vuelve más difícil.

Qué son los procesos de decisión de Markov

Un proceso de decisión de Markov o MDP es un marco matemático utilizado para representar problemas de decisión secuencial.

Incluye estados, acciones, transiciones, recompensas y un factor de descuento. La propiedad de Markov supone que el estado actual contiene la información necesaria para modelar el futuro, sin necesitar todo el historial.

En muchos entornos reales, esta condición no se cumple de forma perfecta. La observación disponible puede ocultar información. En ese caso hablamos de un problema parcialmente observable.

El MDP ayuda a formular el problema con precisión. Obliga a definir qué conoce el agente, qué puede hacer, cómo cambia el sistema y qué pretende optimizar.

Si no podemos describir estas piezas de forma razonable, probablemente todavía no estamos preparados para elegir un algoritmo.

Exploración y explotación

La exploración consiste en probar acciones para obtener información. La explotación consiste en utilizar la opción que actualmente parece mejor.

Si el agente explota demasiado pronto, puede quedarse con una estrategia mediocre. Si explora constantemente, no aprovecha lo aprendido.

Este equilibrio aparece en casi todos los problemas de refuerzo.

Una estrategia sencilla es epsilon-greedy. La mayor parte del tiempo selecciona la acción con mayor valor estimado y, con cierta probabilidad, elige una alternativa.

Otros algoritmos introducen exploración mediante políticas estocásticas, ruido, entropía, incertidumbre o incentivos intrínsecos.

En sistemas que afectan a personas, la exploración no puede tratarse como un experimento sin límites. Debe respetar seguridad, privacidad, equidad y calidad mínima.

Problema de los bandidos multibrazo

El multi-armed bandit representa una versión simplificada del aprendizaje por refuerzo. El agente elige entre varias opciones y observa una recompensa, pero la acción no modifica un estado complejo.

Puede utilizarse para seleccionar creatividades, recomendaciones, asuntos de email o variantes de una experiencia.

A diferencia de un test A/B tradicional, el bandido puede reasignar progresivamente más tráfico hacia las opciones que parecen funcionar mejor.

Sin embargo, necesita suficiente exploración para evitar conclusiones prematuras. También debe adaptarse cuando el rendimiento cambia con el tiempo.

El enfoque bandit resulta adecuado cuando las decisiones son repetidas, las recompensas aparecen con rapidez y no existen consecuencias secuenciales importantes.

Diferencias entre aprendizaje supervisado, no supervisado y por refuerzo

En aprendizaje supervisado, el modelo recibe ejemplos con respuestas conocidas. Aprende una relación entre entradas y salidas.

En aprendizaje no supervisado, busca estructura sin disponer de una etiqueta para cada ejemplo. Puede agrupar, reducir dimensiones o aprender representaciones.

En aprendizaje por refuerzo, un agente selecciona acciones y aprende mediante las consecuencias de su comportamiento.

  • Supervisado: aprende a partir de pares de entrada y respuesta.
  • No supervisado: busca patrones sin etiquetas completas.
  • Por refuerzo: aprende una estrategia mediante interacción y recompensas.

Un modelo supervisado puede predecir qué producto tiene mayor probabilidad de compra. Un agente de refuerzo podría utilizar esa predicción junto con el estado del usuario y decidir qué secuencia de recomendaciones mostrar.

Las técnicas también pueden combinarse. Un modelo puede preentrenarse con aprendizaje supervisado y ajustarse posteriormente mediante refuerzo.

Diferencias entre aprendizaje supervisado y aprendizaje por refuerzo

La diferencia principal está en el tipo de señal y en la naturaleza del problema.

El aprendizaje supervisado recibe la respuesta correcta o un valor objetivo para cada ejemplo. El refuerzo recibe recompensas que pueden aparecer tarde y no indican directamente qué acción habría sido la correcta.

En supervisado, los ejemplos suelen considerarse independientes. En RL, las decisiones cambian los datos que el agente observará después.

Además, el agente debe equilibrar exploración y explotación. Un clasificador supervisado no necesita probar acciones para descubrir sus consecuencias.

Cuando una empresa dispone de históricos de decisiones y resultados, puede parecer que tiene un problema de refuerzo. Sin embargo, esos datos solo muestran las acciones que se tomaron, no lo que habría sucedido con las alternativas. Esta limitación complica la evaluación fuera de línea.

Diferencia entre aprendizaje por refuerzo y aprendizaje profundo

Aprendizaje por refuerzo y deep learning describen dimensiones diferentes.

El refuerzo define cómo aprende el agente mediante interacción y recompensa. El deep learning describe el uso de redes neuronales profundas para aprender representaciones.

Un algoritmo de refuerzo puede utilizar tablas y no contener ninguna red neuronal. Una red profunda puede entrenarse de forma supervisada y no utilizar refuerzo.

Cuando combinamos ambas técnicas hablamos de deep reinforcement learning o aprendizaje por refuerzo profundo.

Esta combinación permite trabajar con imágenes, texto, espacios continuos y estados de gran dimensión. También aumenta el coste computacional, la inestabilidad y la dificultad de evaluación.

Qué es el aprendizaje por refuerzo profundo

El aprendizaje por refuerzo profundo utiliza redes neuronales para representar políticas, funciones de valor, modelos del entorno u otros componentes.

Su desarrollo permitió aplicar RL a problemas donde no es posible almacenar un valor para cada situación. Una imagen, por ejemplo, puede contener millones de combinaciones.

La red aprende a extraer representaciones y a relacionarlas con decisiones o valores esperados.

Entre sus aplicaciones aparecen videojuegos, robótica, control, modelos de lenguaje y optimización de sistemas.

No obstante, el deep RL puede ser sensible a hiperparámetros, recompensas, inicialización y distribución de experiencia. Un resultado obtenido en un entorno no garantiza un despliegue fiable.

Tipos de aprendizaje por refuerzo

Podemos clasificar los métodos según diferentes criterios.

  • Basados en modelo o sin modelo.
  • Basados en valor o basados en política.
  • On-policy u off-policy.
  • Tabulares o con aproximación de funciones.
  • Con recompensa externa o intrínseca.
  • Online u offline.
  • Para acciones discretas o continuas.

Estas categorías no son excluyentes. Un algoritmo puede ser off-policy, model-free, actor-critic y utilizar redes profundas.

La clasificación ayuda a comprender qué información necesita, cómo reutiliza la experiencia y qué problemas puede resolver.

Aprendizaje basado en modelo y sin modelo

Los métodos basados en modelo utilizan o aprenden una representación de cómo cambia el entorno.

El agente puede imaginar consecuencias, planificar y comparar secuencias antes de ejecutarlas.

Los métodos sin modelo aprenden políticas o funciones de valor sin construir explícitamente esa dinámica.

Los enfoques basados en modelo pueden aprovechar mejor la experiencia, pero dependen de la calidad del modelo. Una simulación incorrecta produce planes incorrectos.

Los métodos sin modelo suelen necesitar más interacciones, aunque evitan algunos errores de modelado.

Aprendizaje basado en valor y basado en política

Los métodos basados en valor aprenden cuánto vale estar en un estado o ejecutar una acción. La política se deriva eligiendo las acciones con mayor valor.

Los métodos basados en política optimizan directamente los parámetros de la estrategia.

Las políticas directas resultan útiles en espacios continuos y cuando una distribución de acciones es importante.

Los métodos actor-critic combinan ambos enfoques. El actor representa la política y el crítico estima su valor para orientar las actualizaciones.

Aprendizaje on-policy y off-policy

Un método on-policy aprende sobre la misma política que utiliza para recopilar experiencia.

Un método off-policy puede aprender una política objetivo utilizando datos generados por otra estrategia.

Los métodos off-policy pueden reutilizar información almacenada y ser más eficientes en determinados entornos. También deben corregir la diferencia entre la política que generó los datos y la que se está optimizando.

La elección afecta al diseño de la infraestructura y a la posibilidad de aprender con históricos.

Aprendizaje por refuerzo online y offline

En RL online, el agente recopila experiencia mientras aprende. Sus decisiones influyen en los datos futuros.

En RL offline, el modelo aprende a partir de un conjunto fijo de transiciones previamente registrado.

El aprendizaje offline resulta atractivo cuando interactuar resulta caro, lento o arriesgado. Sin embargo, el dataset puede no cubrir las acciones que la nueva política querría ejecutar.

Si el agente propone decisiones muy alejadas de los datos disponibles, sus estimaciones pueden ser poco fiables.

La evaluación offline necesita especial rigor. Un buen resultado sobre históricos no garantiza que la política produzca el mismo efecto cuando cambie el comportamiento del sistema.

Principales algoritmos de aprendizaje por refuerzo

No existe un algoritmo universal. Cada familia responde a distintos espacios de acción, disponibilidad de datos, estabilidad y coste.

Entre los principales algoritmos encontramos:

  • Programación dinámica.
  • Métodos Monte Carlo.
  • Temporal Difference.
  • SARSA.
  • Q-learning.
  • Deep Q-Network.
  • Policy Gradient.
  • REINFORCE.
  • Actor-Critic.
  • A2C y A3C.
  • PPO.
  • DDPG.
  • TD3.
  • SAC.
  • GRPO.

La recomendación práctica es comenzar por la estructura del problema. Después podemos comparar algoritmos mediante una evaluación consistente.

Qué es Q-learning

Q-learning es un algoritmo que aprende el valor esperado de ejecutar una acción en un estado y continuar después con una estrategia óptima.

La función Q permite comparar las acciones disponibles. El agente actualiza sus estimaciones utilizando la recompensa recibida y el mejor valor esperado desde el siguiente estado.

Es un método off-policy porque puede aprender sobre una política óptima mientras recopila datos mediante otra estrategia exploratoria.

En problemas pequeños, los valores pueden almacenarse en una tabla. Cuando el espacio crece, necesitamos aproximarlos mediante un modelo.

Q-learning resulta útil para comprender conceptos como recompensa futura, actualización temporal, exploración y convergencia.

Diferencias entre Q-learning y SARSA

SARSA aprende el valor de la política que realmente está siguiendo. Su actualización utiliza el estado actual, la acción actual, la recompensa, el siguiente estado y la siguiente acción.

Q-learning utiliza el valor de la mejor acción estimada en el siguiente estado, aunque el agente no vaya a ejecutarla durante la exploración.

Por eso Q-learning es off-policy y SARSA es on-policy.

En entornos donde las acciones exploratorias implican riesgo, SARSA puede aprender una política más conservadora al incorporar las consecuencias de la propia exploración.

Deep Q-Network

Deep Q-Network o DQN utiliza una red neuronal para aproximar la función Q.

La red recibe una representación del estado y produce valores para las acciones disponibles.

Para estabilizar el entrenamiento utiliza mecanismos como un buffer de experiencia y una red objetivo. El buffer permite reutilizar transiciones y reducir la correlación entre ejemplos consecutivos.

DQN está diseñado principalmente para acciones discretas. No resulta directamente adecuado cuando el agente debe seleccionar cualquier valor dentro de un rango continuo.

Su importancia histórica procede de demostrar que una misma arquitectura podía aprender a jugar diferentes videojuegos utilizando píxeles y recompensas como principales señales.

Métodos de gradiente de política

Los métodos de policy gradient optimizan directamente una política parametrizada.

En lugar de aprender únicamente cuánto vale cada acción y seleccionar la mejor, modifican la probabilidad de ejecutar acciones según los retornos observados.

REINFORCE es uno de los algoritmos más sencillos de esta familia. Aumenta la probabilidad de acciones asociadas con buenos retornos y reduce la de aquellas vinculadas con resultados peores.

Estos métodos pueden trabajar con políticas estocásticas y acciones continuas. Su principal dificultad es la alta varianza de las estimaciones.

Para reducirla suelen utilizarse baselines, críticos y técnicas de normalización.

Qué es Actor-Critic

Actor-Critic combina una política y una función de valor.

El actor selecciona acciones. El crítico evalúa la calidad de esas decisiones y proporciona una señal para actualizar la política.

Esta estructura intenta combinar la flexibilidad de los métodos basados en política con la eficiencia de los métodos basados en valor.

Muchas familias modernas utilizan esta idea, aunque difieren en cómo actualizan el actor, cómo construyen el crítico y cómo recopilan experiencia.

Qué es PPO

Proximal Policy Optimization o PPO es un algoritmo de optimización de políticas diseñado para realizar actualizaciones útiles sin modificar el comportamiento de forma excesiva en cada paso.

Utiliza un objetivo recortado que limita cambios demasiado grandes entre la política anterior y la nueva.

PPO se ha utilizado ampliamente por su equilibrio entre rendimiento, estabilidad y relativa sencillez.

Puede aplicarse a control, simulaciones, robótica y ajuste de modelos generativos, entre otros ámbitos.

Su popularidad no significa que funcione sin ajustes. La recompensa, el tamaño de lote, la estimación de ventajas y la diversidad de experiencias continúan siendo importantes.

DDPG, TD3 y SAC

DDPG es un algoritmo actor-critic off-policy diseñado para espacios de acción continuos. Aprende una política determinista y una función Q.

TD3 introduce modificaciones para reducir la sobreestimación de valores y mejorar la estabilidad.

Soft Actor-Critic o SAC aprende una política estocástica y añade un objetivo de entropía. No busca únicamente recompensa, sino también mantener cierta diversidad en las acciones.

Estos algoritmos se utilizan en problemas de control continuo, aunque su rendimiento depende de la simulación, la escala de recompensas y la calidad de la exploración.

Qué es GRPO

Group Relative Policy Optimization o GRPO es un método de optimización de políticas que compara las recompensas de varias respuestas generadas para una misma entrada.

En lugar de entrenar un crítico independiente como en ciertas implementaciones de PPO, utiliza resultados relativos dentro del grupo para estimar ventajas.

Esta estrategia puede reducir el consumo asociado con el modelo de valor y ha adquirido visibilidad por su uso en modelos de razonamiento.

GRPO no convierte automáticamente cualquier modelo en un buen razonador. Necesita un modelo base competente, datos adecuados, recompensas verificables, diversidad de muestras y un entrenamiento estable.

Cómo funciona el aprendizaje por refuerzo en DeepSeek

DeepSeek-R1 popularizó el uso del aprendizaje por refuerzo para mejorar el razonamiento de modelos de lenguaje.

DeepSeek-R1-Zero partió de un modelo base previamente entrenado y aplicó refuerzo a gran escala sin utilizar primero una fase convencional de ajuste supervisado orientada al razonamiento. Esto no significa que el sistema empezara desde cero ni que aprendiera lenguaje únicamente con recompensas.

El modelo generaba varias respuestas para cada problema. Estas respuestas recibían señales relacionadas con la corrección y con determinadas reglas de formato. GRPO utilizaba las recompensas relativas del grupo para actualizar la política.

Durante el proceso aparecieron comportamientos de razonamiento, revisión y adaptación. También surgieron problemas de legibilidad y mezcla de idiomas.

DeepSeek-R1 incorporó posteriormente datos de arranque y un entrenamiento multietapa para mejorar calidad, claridad y capacidad general.

La lección práctica no consiste en asumir que el aprendizaje supervisado ha dejado de ser necesario. El caso muestra que el refuerzo puede potenciar capacidades de razonamiento cuando parte de un modelo base fuerte y utiliza tareas con recompensas que pueden verificarse.

Aprendizaje por refuerzo en modelos de lenguaje

Los modelos de lenguaje pueden ajustarse mediante señales de recompensa para favorecer respuestas útiles, seguras, correctas o alineadas con determinados criterios.

El proceso puede incluir:

  • Un modelo base previamente entrenado.
  • Datos de instrucciones.
  • Respuestas candidatas.
  • Preferencias humanas o sintéticas.
  • Un modelo o función de recompensa.
  • Un algoritmo de optimización de políticas.
  • Evaluaciones de calidad y seguridad.

En RLHF, las preferencias humanas ayudan a construir una señal de recompensa. En otros enfoques se utilizan reglas verificables, jueces automáticos o principios definidos.

La recompensa puede mejorar determinados comportamientos y empeorar otros. Un modelo muy optimizado para una prueba concreta puede aprender estrategias poco generales.

También puede producir reward hacking, respuestas excesivamente largas, complacencia o patrones destinados a satisfacer al evaluador sin resolver correctamente la tarea.

Dentro de nuestro curso de inteligencia artificial avanzada trabajamos estos sistemas desde el control del proceso: objetivo, contexto, salida, evaluación, límites y revisión humana.

Aplicaciones del aprendizaje por refuerzo

El aprendizaje por refuerzo puede aplicarse a tareas donde existen decisiones repetidas, consecuencias medibles y capacidad para aprender de la interacción.

Entre sus aplicaciones encontramos:

  • Robótica.
  • Videojuegos.
  • Control industrial.
  • Gestión energética.
  • Logística.
  • Asignación de recursos.
  • Recomendación.
  • Publicidad.
  • Sistemas de diálogo.
  • Modelos de lenguaje.
  • Optimización de redes.
  • Planificación.

La existencia de una aplicación teórica no significa que RL sea la opción más rentable. En muchos proyectos, reglas, optimización clásica o aprendizaje supervisado ofrecen una solución más estable.

Aprendizaje por refuerzo en robótica

En robótica, un agente puede aprender movimientos, agarres, navegación y control.

La interacción física resulta lenta y puede dañar el equipo. Por eso gran parte del entrenamiento suele realizarse en simuladores.

Después se aplican técnicas para reducir la diferencia entre simulación y realidad, como variar condiciones, ruido, parámetros físicos y entornos.

La seguridad debe mantenerse fuera de la política aprendida mediante límites de movimiento, parada, zonas prohibidas y supervisión.

Un robot que obtiene una buena recompensa media todavía puede ejecutar ocasionalmente una acción peligrosa. La evaluación necesita analizar fallos extremos, no solo promedios.

Aprendizaje por refuerzo en videojuegos

Los videojuegos ofrecen entornos controlados, recompensas y la posibilidad de ejecutar muchas simulaciones.

Un agente puede aprender estrategias a partir del estado del juego, las acciones disponibles y el resultado de las partidas.

Este ámbito ha permitido estudiar exploración, planificación, cooperación y aprendizaje con observaciones visuales.

Sin embargo, dominar un videojuego no implica comprender el mundo. El agente aprende dentro de unas reglas y una distribución concreta.

Aprendizaje por refuerzo en marketing digital

En marketing puede utilizarse cuando una decisión actual afecta al comportamiento posterior y existe una secuencia de interacciones.

Algunos casos son:

  • Selección de contenidos.
  • Recomendación de productos.
  • Optimización de frecuencia.
  • Secuencias de mensajes.
  • Asignación dinámica de presupuesto.
  • Personalización de experiencias.
  • Elección de ofertas.

La recompensa debería representar valor empresarial y experiencia, no únicamente clics.

Un sistema que optimiza el CTR puede aprender a utilizar mensajes exagerados. Otro que maximiza conversiones inmediatas puede saturar a los usuarios con descuentos.

En una revisión profesional conviene incorporar margen, recurrencia, cancelaciones, frecuencia y señales de satisfacción.

Aprendizaje por refuerzo en publicidad

La publicidad digital incluye decisiones repetidas sobre pujas, presupuesto, audiencias, creatividades y frecuencia.

Los algoritmos pueden aprender a asignar recursos según el contexto y el resultado esperado.

Sin embargo, la atribución publicitaria no representa necesariamente causalidad. Una conversión observada después de una impresión no demuestra que la publicidad la haya provocado.

Si entrenamos una política con recompensas atribuidas de forma incorrecta, puede concentrar inversión en personas que habrían comprado igualmente.

La evaluación necesita experimentos, grupos de control o métodos incrementales cuando el impacto lo justifique.

Aprendizaje por refuerzo en ecommerce

En ecommerce puede utilizarse para gestionar recomendaciones, promociones, inventario, logística y navegación.

Un agente podría decidir qué producto mostrar teniendo en cuenta la sesión, el historial, el stock y la probabilidad de compra futura.

La recompensa puede combinar compra, margen, devolución y recurrencia.

La dificultad consiste en que muchas consecuencias aparecen tarde. Una recomendación puede generar una venta hoy y aumentar una devolución mañana.

También existe un problema de exploración. Mostrar opciones experimentales tiene un coste de oportunidad y puede perjudicar la experiencia.

Aprendizaje por refuerzo en sistemas de recomendación

Un recomendador supervisado predice normalmente la probabilidad de interacción con un elemento. Un sistema de refuerzo puede optimizar una secuencia completa de recomendaciones.

Esta diferencia permite considerar diversidad, descubrimiento, satisfacción futura y fatiga.

El estado puede incluir comportamiento reciente, historial, contexto y productos disponibles. La acción consiste en seleccionar uno o varios elementos.

La recompensa puede combinar clic, consumo, compra, retención y señales negativas.

El diseño debe evitar crear cámaras de repetición donde el sistema solo muestra aquello que ya sabe que funciona. La exploración y la diversidad pueden formar parte del objetivo.

Aprendizaje por refuerzo en logística e inventario

Las decisiones de inventario afectan a costes, disponibilidad y ventas futuras. Un agente puede aprender políticas de reposición bajo demanda incierta.

El estado puede incluir stock, pedidos, previsiones, tiempos de suministro y capacidad. Las acciones determinan cantidades o asignaciones.

La recompensa debe incorporar ventas, roturas, exceso, almacenamiento y costes operativos.

La simulación necesita representar estacionalidad, promociones y retrasos. Si simplifica demasiado el entorno, la política puede fallar durante situaciones reales.

Aprendizaje por refuerzo en energía y control industrial

Los sistemas energéticos requieren decisiones continuas sobre consumo, almacenamiento, producción y climatización.

Un agente puede intentar minimizar costes sin incumplir restricciones de servicio o seguridad.

En estos casos, las restricciones deben tratarse explícitamente. Una política no debería explorar decisiones capaces de dañar instalaciones.

La implantación suele comenzar en simulación, continuar mediante recomendaciones y avanzar hacia control limitado después de validar estabilidad.

Ventajas del aprendizaje por refuerzo

  • Permite optimizar decisiones secuenciales.
  • Considera consecuencias futuras.
  • Puede aprender estrategias complejas.
  • Se adapta a entornos interactivos.
  • Combina exploración y aprovechamiento.
  • Puede utilizar simulaciones.
  • Admite acciones discretas y continuas.
  • Puede mejorar mediante experiencia acumulada.

Su principal ventaja aparece cuando el resultado depende de una secuencia y no de una predicción aislada.

También permite descubrir estrategias que no fueron programadas explícitamente. Esta capacidad puede producir soluciones eficaces y comportamientos inesperados.

Desventajas y limitaciones

  • Puede necesitar muchas interacciones.
  • El entrenamiento puede ser inestable.
  • Diseñar recompensas resulta difícil.
  • La exploración puede ser costosa.
  • La simulación puede diferir de la realidad.
  • La evaluación es compleja.
  • Puede explotar errores de la recompensa.
  • Requiere infraestructura y monitorización.
  • Puede ser difícil de interpretar.
  • Los cambios del entorno reducen su rendimiento.

La eficiencia de muestra es una limitación importante. Un ser humano puede aprender de pocos intentos, mientras determinados algoritmos necesitan millones de interacciones.

En un entorno físico, comercial o sanitario, esa cantidad puede resultar inviable.

Reward hacking y especificación incorrecta

Reward hacking aparece cuando el agente encuentra una forma de obtener recompensa sin cumplir el objetivo real.

No significa que el sistema tenga intención de engañar. Optimiza exactamente la señal que se le ha proporcionado.

Algunos patrones habituales son:

  • Explotar errores del simulador.
  • Repetir una acción que genera recompensa.
  • Evitar situaciones difíciles en lugar de resolverlas.
  • Manipular una métrica intermedia.
  • Maximizar volumen y sacrificar calidad.

Para reducirlo debemos probar escenarios adversos, combinar métricas, incorporar restricciones y revisar comportamientos concretos.

Una función más compleja tampoco garantiza seguridad. Puede introducir incentivos contradictorios difíciles de detectar.

Problema de asignación de crédito

La asignación de crédito consiste en determinar qué acciones fueron responsables de una recompensa recibida posteriormente.

Si un agente obtiene un resultado después de cien decisiones, necesita estimar cuáles contribuyeron realmente.

Las recompensas retrasadas aumentan la dificultad. Una acción aparentemente irrelevante puede haber abierto una oportunidad futura.

Las funciones de valor, la retropropagación temporal y las estimaciones de ventaja ayudan a distribuir la señal.

En marketing encontramos el mismo problema cuando una conversión sigue a múltiples contactos. No deberíamos convertir un modelo de atribución simplificado en una recompensa sin analizar sus consecuencias.

Seguridad en aprendizaje por refuerzo

La seguridad exige controlar qué puede explorar el agente, cómo se evalúa y qué ocurre cuando falla.

Las medidas pueden incluir:

  • Restricciones de acciones.
  • Entornos simulados.
  • Límites operativos.
  • Revisión humana.
  • Pruebas adversas.
  • Monitorización.
  • Parada de emergencia.
  • Despliegue gradual.

Un promedio elevado no demuestra que el sistema sea seguro. Necesitamos estudiar eventos raros y consecuencias extremas.

En decisiones de alto impacto conviene mantener una política de respaldo o un sistema determinista que tome el control cuando la incertidumbre supera un umbral.

Cómo diseñar una recompensa correctamente

El diseño comienza definiendo el resultado empresarial o funcional.

Después debemos identificar comportamientos deseados, efectos negativos, restricciones y señales observables.

Una metodología práctica incluye:

  • Definir el objetivo final.
  • Separar resultado y métricas proxy.
  • Identificar posibles atajos.
  • Incorporar costes y riesgos.
  • Probar comportamientos extremos.
  • Analizar segmentos.
  • Revisar la recompensa durante el entrenamiento.

No conviene añadir recompensas intermedias sin comprobar su efecto. Pueden acelerar el aprendizaje y orientar hacia una estrategia equivocada.

La función debería ser lo bastante informativa para aprender y lo bastante fiel para no sustituir el objetivo.

Cómo desarrollar un proyecto de aprendizaje por refuerzo

Definir la decisión

Debemos concretar qué acción tomará el agente y con qué frecuencia.

Definir el entorno

Mapeamos estados, observaciones, transiciones, episodios y restricciones.

Diseñar la recompensa

Traducimos el objetivo a señales medibles y analizamos posibles atajos.

Construir un baseline

Comparamos con reglas, optimización o modelos sencillos.

Crear o seleccionar un simulador

El entorno debe representar las dinámicas relevantes.

Elegir el algoritmo

La decisión depende de acciones, datos, estabilidad y recursos.

Entrenar

Controlamos semillas, hiperparámetros, experiencia y evolución de recompensas.

Evaluar

Analizamos retorno, restricciones, estabilidad, generalización y comportamiento.

Desplegar gradualmente

Empezamos mediante recomendaciones, límites o una parte reducida del tráfico.

Monitorizar

Comprobamos cambios del entorno, desviaciones, recompensas y efectos secundarios.

Cómo evaluar un agente de aprendizaje por refuerzo

La evaluación no debería depender únicamente de la recompensa media obtenida durante el entrenamiento.

Conviene analizar:

  • Retorno medio.
  • Variabilidad.
  • Peores resultados.
  • Estabilidad entre ejecuciones.
  • Cumplimiento de restricciones.
  • Generalización a escenarios nuevos.
  • Coste de interacción.
  • Latencia.
  • Comportamientos inesperados.

Los algoritmos pueden ser sensibles a la semilla aleatoria. Una única ejecución positiva no demuestra que el método sea robusto.

También necesitamos evaluar contra políticas sencillas. Una regla bien diseñada puede resultar más estable y barata.

En un proyecto de analítica y medición, recomendamos conectar la métrica técnica con el resultado empresarial y con los riesgos que el promedio puede ocultar.

Aprendizaje por refuerzo con Python

Python es uno de los lenguajes más utilizados para experimentar con reinforcement learning por su ecosistema de machine learning, simulación y análisis.

Las herramientas pueden dividirse en varias capas:

  • Entornos y simuladores.
  • Bibliotecas numéricas.
  • Frameworks de redes neuronales.
  • Implementaciones de algoritmos.
  • Herramientas de experimentación.
  • Sistemas de despliegue.

Gymnasium ofrece una interfaz habitual para entornos. PyTorch y TensorFlow permiten construir redes. Bibliotecas especializadas proporcionan implementaciones de algoritmos como PPO, DQN y SAC.

La facilidad para ejecutar un ejemplo no debe confundirse con la capacidad para desplegar un agente. La producción necesita datos, monitorización, límites, control de versiones y evaluación continua.

Aprendizaje por refuerzo con TensorFlow y Keras

TensorFlow y Keras permiten crear redes utilizadas por agentes, funciones de valor y modelos del entorno.

Un proyecto puede definir una red que recibe el estado, produce valores o acciones y se actualiza mediante gradientes.

También existen componentes y bibliotecas orientados a reinforcement learning que ayudan a estructurar políticas, buffers, entornos y entrenamiento.

La elección entre TensorFlow, Keras, PyTorch u otro framework debería considerar el conocimiento del equipo, las integraciones, el despliegue y el mantenimiento.

No existe una ventaja universal. En un proyecto real resulta más importante que el equipo pueda reproducir, probar y mantener el sistema.

Ejemplo sencillo de aprendizaje por refuerzo

Imaginemos un agente dentro de una cuadrícula. Debe llegar desde una posición inicial hasta una meta.

Puede moverse arriba, abajo, izquierda o derecha. Recibe una pequeña penalización por cada paso, una penalización mayor al chocar y una recompensa positiva al alcanzar la meta.

Al principio explora y realiza movimientos poco eficientes. Después aprende qué acciones conducen a estados con mayor valor.

La penalización por paso incentiva rutas cortas. Sin ella, cualquier camino que termine en la meta podría resultar equivalente.

Este ejemplo permite observar estados, acciones, recompensas, episodios, exploración y función Q sin introducir todavía redes profundas.

Ejemplo de aprendizaje por refuerzo en tres en raya

En tres en raya, el estado representa la disposición del tablero y la acción corresponde a colocar una ficha en una casilla disponible.

El agente puede recibir una recompensa positiva al ganar, negativa al perder y neutra al empatar.

Mediante partidas repetidas aprende qué posiciones conducen a mejores resultados.

El problema es pequeño y permite almacenar valores de estados. No necesita necesariamente una red neuronal.

Este caso demuestra que reinforcement learning no significa siempre deep learning ni grandes modelos.

Aprendizaje por refuerzo y castigo

En machine learning, una recompensa negativa puede utilizarse para penalizar determinados resultados. Sin embargo, hablar de “refuerzo y castigo” puede introducir conceptos procedentes de la psicología que no coinciden exactamente con la formulación informática.

Un número negativo no castiga emocionalmente al agente. Reduce el retorno asociado con una trayectoria y modifica las actualizaciones.

Además, una recompensa negativa no garantiza que el comportamiento desaparezca. El agente compara todas las alternativas y puede aceptar una penalización si conduce a una recompensa mayor.

Por ejemplo, un robot puede asumir un coste energético para completar una tarea valiosa.

La función debe representar compensaciones y consecuencias, no una clasificación moral entre acciones buenas y malas.

Aprendizaje por refuerzo en psicología y Skinner

En psicología conductista, el refuerzo se relaciona con consecuencias que aumentan la probabilidad de una conducta. B. F. Skinner estudió el condicionamiento operante y la relación entre comportamiento y consecuencias.

El refuerzo positivo introduce un estímulo después de una conducta para aumentar su frecuencia. El refuerzo negativo elimina una condición desagradable con el mismo objetivo de aumentar una conducta.

El castigo busca reducir una conducta, mientras que el refuerzo busca aumentarla. Por eso refuerzo negativo y castigo no son sinónimos.

El aprendizaje por refuerzo computacional tomó inspiración general de estos conceptos, pero desarrolló un marco matemático propio basado en agentes, estados, acciones, recompensas, políticas y retornos.

No conviene trasladar directamente conclusiones psicológicas hacia algoritmos ni explicar el comportamiento humano como si fuera una política optimizada mediante una única función numérica.

Diferencia entre refuerzo positivo, negativo y castigo

En psicología, “positivo” significa añadir un estímulo y “negativo” significa retirarlo. No equivalen necesariamente a bueno y malo.

  • Refuerzo positivo: añade una consecuencia para aumentar una conducta.
  • Refuerzo negativo: elimina una consecuencia para aumentar una conducta.
  • Castigo positivo: añade una consecuencia para reducir una conducta.
  • Castigo negativo: retira una consecuencia para reducir una conducta.

En machine learning suele hablarse de recompensas positivas y negativas, pero esta terminología no reproduce completamente esa clasificación psicológica.

La diferencia debe explicarse para evitar que una consulta sobre Skinner termine mezclada con algoritmos como Q-learning o PPO.

Cuándo utilizar aprendizaje por refuerzo

Puede resultar adecuado cuando:

  • Existen decisiones secuenciales.
  • Las acciones modifican el futuro.
  • La recompensa puede definirse.
  • Existe un entorno o simulador.
  • La interacción puede recopilarse de forma segura.
  • Una política fija resulta insuficiente.
  • El beneficio potencial justifica la complejidad.

También necesitamos suficiente capacidad técnica para entrenar, evaluar, desplegar y mantener el agente.

El caso más claro aparece cuando optimizar cada decisión de forma independiente produce un resultado peor que considerar la secuencia completa.

Cuándo no utilizar aprendizaje por refuerzo

No conviene utilizarlo únicamente porque el término sea avanzado o porque una herramienta lo ofrezca.

Puede no ser adecuado cuando:

  • El problema es una clasificación simple.
  • No existe una recompensa fiable.
  • Las acciones no afectan al futuro.
  • No podemos explorar con seguridad.
  • Los datos disponibles son insuficientes.
  • No existe simulador ni interacción.
  • Una regla resuelve la tarea.
  • La decisión exige explicabilidad estricta.
  • El coste supera el valor esperado.

En muchas empresas, el primer paso no es entrenar un agente, sino mejorar datos, procesos y medición.

Errores frecuentes en aprendizaje por refuerzo

Empezar por el algoritmo

El equipo selecciona PPO o Q-learning antes de definir estados, acciones y recompensas.

Diseñar una recompensa superficial

El agente optimiza clics, volumen o tiempo y perjudica el objetivo real.

Confiar demasiado en la simulación

La política aprende características que no existen en producción.

Evaluar una única ejecución

El rendimiento depende del azar y no se comprueba la estabilidad.

Explorar directamente en producción

El agente prueba acciones que afectan a clientes, ingresos o seguridad.

Ignorar las restricciones

La recompensa no impide comportamientos inaceptables.

No comparar con un baseline

No sabemos si el sistema mejora una regla sencilla.

Confundir recompensa con valor empresarial

La métrica proxy se trata como si fuera el objetivo final.

No monitorizar

El entorno cambia y la política continúa actuando con estimaciones antiguas.

Automatizar demasiado pronto

La empresa entrega control al agente antes de comprender sus fallos.

Cómo auditar un sistema de aprendizaje por refuerzo

Objetivo

Comprobamos qué decisión mejora y si necesita realmente un enfoque secuencial.

Entorno

Revisamos estados, observaciones, acciones, transiciones y episodios.

Recompensa

Analizamos si representa el objetivo y qué atajos podría explotar el agente.

Datos

Comprobamos cobertura, calidad, sesgos, versiones y permisos.

Algoritmo

Evaluamos si encaja con el espacio de acciones, el entorno y los recursos.

Evaluación

Revisamos semillas, escenarios, peores casos, generalización y comparación.

Seguridad

Analizamos límites, supervisión, parada y política de respaldo.

Despliegue

Comprobamos latencia, integración, capacidad de revertir y monitorización.

La auditoría debe terminar con decisiones: rediseñar la recompensa, mejorar el simulador, limitar acciones, recopilar datos o descartar RL cuando no aporta una ventaja clara.

Checklist para un proyecto de aprendizaje por refuerzo

  • ¿Existe una decisión secuencial?
  • ¿Las acciones modifican estados futuros?
  • ¿Está definido el agente?
  • ¿Está delimitado el entorno?
  • ¿Las observaciones contienen información suficiente?
  • ¿El espacio de acciones es seguro?
  • ¿La recompensa representa el objetivo?
  • ¿Se han analizado posibles atajos?
  • ¿Existe un factor temporal adecuado?
  • ¿Disponemos de simulación o datos?
  • ¿La experiencia es representativa?
  • ¿Existe una política de referencia?
  • ¿El algoritmo encaja con acciones discretas o continuas?
  • ¿Se han probado varias semillas?
  • ¿Se evalúa la variabilidad?
  • ¿Se analizan los peores casos?
  • ¿El agente respeta restricciones?
  • ¿Existe supervisión humana?
  • ¿Podemos detenerlo?
  • ¿Existe una política de respaldo?
  • ¿El despliegue será gradual?
  • ¿Se monitorizan cambios del entorno?
  • ¿Se controlan versiones?
  • ¿El coste es sostenible?
  • ¿RL mejora realmente las alternativas?

Preguntas frecuentes sobre aprendizaje por refuerzo

Qué es el aprendizaje por refuerzo en pocas palabras

Es un tipo de machine learning donde un agente aprende a tomar decisiones mediante acciones, recompensas y experiencia.

Qué significa reinforcement learning

Significa aprendizaje por refuerzo.

Cuál es el objetivo del aprendizaje por refuerzo

Aprender una política que maximice la recompensa acumulada esperada.

Cómo aprende un modelo por refuerzo

Interactúa con un entorno, observa consecuencias y actualiza su política o sus estimaciones de valor.

Cuáles son sus elementos principales

Agente, entorno, estado, observación, acción, recompensa, política, función de valor y modelo del entorno.

Qué es un agente

Es la entidad que toma decisiones dentro del entorno.

Qué es una política

Es la estrategia utilizada para seleccionar acciones.

Qué es una recompensa

Es una señal numérica que orienta el aprendizaje.

Qué busca maximizar un agente

La recompensa acumulada esperada, también denominada retorno.

Qué es una función Q

Es una estimación del retorno esperado al ejecutar una acción en un estado.

Qué es Q-learning

Es un algoritmo off-policy que aprende valores de acción.

Qué es SARSA

Es un algoritmo on-policy que aprende utilizando la acción que la política ejecutará realmente.

Qué diferencia existe entre Q-learning y SARSA

Q-learning actualiza hacia la mejor acción estimada; SARSA utiliza la siguiente acción seleccionada por su política.

Qué es PPO

Es un algoritmo de optimización de políticas que limita actualizaciones excesivas.

Qué es GRPO

Es un método que utiliza recompensas relativas entre grupos de respuestas para optimizar una política sin un crítico independiente tradicional.

Qué es el aprendizaje por refuerzo profundo

Es la combinación de reinforcement learning y redes neuronales profundas.

Qué diferencia existe entre deep learning y reinforcement learning

Deep learning describe el uso de redes profundas; reinforcement learning describe el aprendizaje mediante interacción y recompensa.

Qué diferencia existe con el aprendizaje supervisado

El supervisado recibe respuestas conocidas; el refuerzo recibe recompensas y debe descubrir una estrategia.

Qué diferencia existe con el aprendizaje no supervisado

El no supervisado busca estructura en datos; el refuerzo optimiza acciones dentro de un entorno.

Qué es exploración

Es probar acciones para obtener información sobre sus consecuencias.

Qué es explotación

Es utilizar la acción que actualmente parece producir el mejor resultado.

Qué es un proceso de decisión de Markov

Es un marco matemático para representar estados, acciones, transiciones y recompensas.

Qué es un episodio

Es una trayectoria completa desde un inicio hasta una condición final.

Qué es aprendizaje on-policy

Es aprender sobre la misma política utilizada para recopilar experiencia.

Qué es aprendizaje off-policy

Es aprender una política utilizando datos generados por otra estrategia.

Qué es aprendizaje basado en modelo

Es un enfoque que utiliza o aprende cómo evoluciona el entorno.

Qué es aprendizaje sin modelo

Es un enfoque que aprende políticas o valores sin construir explícitamente la dinámica.

Qué es reward hacking

Es la explotación de una función de recompensa de una manera que no cumple la intención real.

Qué es el problema de asignación de crédito

Es la dificultad para determinar qué acciones causaron una recompensa posterior.

Cómo funciona el refuerzo en DeepSeek

DeepSeek-R1 utilizó aprendizaje por refuerzo para mejorar capacidades de razonamiento, combinando generación de respuestas, recompensas y optimización mediante GRPO.

DeepSeek aprendió desde cero mediante refuerzo

No. R1-Zero partió de un modelo base previamente entrenado. “Zero” se refiere a la ausencia de una fase supervisada preliminar específica antes del refuerzo.

Qué aplicaciones tiene

Robótica, juegos, control, energía, logística, recomendación, publicidad y modelos de lenguaje, entre otras.

Puede utilizarse en marketing

Sí, especialmente en decisiones secuenciales como recomendaciones, frecuencia, asignación y personalización.

Puede utilizarse en ecommerce

Sí, en recomendación, promociones, inventario, navegación y logística.

Se puede programar con Python

Sí. Python dispone de bibliotecas, entornos y frameworks para desarrollar agentes.

Se puede utilizar TensorFlow

Sí. TensorFlow y Keras permiten construir las redes utilizadas por algoritmos de refuerzo profundo.

Es necesario utilizar redes neuronales

No. Los problemas pequeños pueden resolverse mediante tablas y métodos clásicos.

Qué relación tiene con Skinner

Comparte inspiración general con el condicionamiento operante, pero el marco computacional utiliza conceptos matemáticos propios.

Refuerzo negativo significa castigo

No. En psicología, el refuerzo negativo aumenta una conducta retirando una condición desagradable.

Cuáles son sus principales riesgos

Recompensas mal diseñadas, exploración peligrosa, inestabilidad, sesgos, fallos de simulación y dificultad de evaluación.

Cuándo debería utilizarse

Cuando existen decisiones secuenciales, consecuencias futuras, una recompensa útil y capacidad segura para aprender.

Cuándo no debería utilizarse

Cuando el problema puede resolverse con clasificación, reglas u optimización más sencilla y estable.

Cómo aplicar el aprendizaje por refuerzo con criterio profesional

El aprendizaje por refuerzo no debería comenzar con la elección de un algoritmo. Debe comenzar con una decisión que realmente necesite optimización secuencial.

En Aula CM definiríamos primero el agente, el entorno, las acciones y la recompensa. Después revisaríamos qué información estará disponible en el momento de actuar y qué consecuencias aparecerán más tarde.

La siguiente fase consistiría en construir una referencia. Una regla, una política fija o un modelo supervisado permiten saber si el agente aporta una mejora suficiente para justificar su complejidad.

También analizaríamos la seguridad antes del entrenamiento. Determinadas acciones deberían quedar prohibidas, limitadas o sometidas a revisión aunque prometan una recompensa alta.

Después crearíamos un entorno controlado y probaríamos varias ejecuciones. No valoraríamos únicamente el retorno medio, sino la variabilidad, los peores casos, el cumplimiento de restricciones y el comportamiento fuera de las condiciones habituales.

Finalmente, desplegaríamos de manera gradual. El agente puede empezar recomendando acciones a una persona. Solo asumiría mayor autonomía después de demostrar estabilidad, trazabilidad y una mejora real del proceso.

Conclusión: ¿Qué es el aprendizaje por refuerzo o Reinforcement Learning?

El aprendizaje por refuerzo es una rama del machine learning donde un agente aprende una estrategia mediante la interacción con un entorno y las recompensas obtenidas.

Sus elementos principales son estados, observaciones, acciones, recompensas, políticas y funciones de valor. El objetivo consiste en maximizar el retorno acumulado y no únicamente el beneficio inmediato.

Existen métodos basados en valor, políticas, modelos, actores y críticos. Entre sus algoritmos más conocidos se encuentran Q-learning, DQN, PPO, SAC y GRPO.

El aprendizaje por refuerzo profundo utiliza redes neuronales para trabajar con estados y decisiones complejas. Esta combinación ha impulsado aplicaciones en juegos, robótica, control, recomendación y modelos de lenguaje como DeepSeek-R1.

Su principal dificultad consiste en diseñar correctamente el objetivo. Un agente optimiza la recompensa que recibe y puede encontrar atajos que no cumplen la intención del proyecto.

La recomendación práctica es utilizar RL solo cuando el problema sea realmente secuencial, exista una forma segura de aprender y la mejora esperada justifique el coste de entrenamiento, evaluación y mantenimiento.

Cuando se aplica con estos criterios, el aprendizaje por refuerzo deja de ser una técnica experimental llamativa y se convierte en una herramienta capaz de diseñar mejores políticas de decisión en sistemas complejos.

Ernesto G BustamanteReinforcement Learning: Qué es, Cómo Funciona el Aprendizaje por Refuerzo y Ejemplos