¿Cómo le decimos a un agente qué queremos? Reward engineering explicado desde cero
Sexta parte de la serie Reinforcement Learning desde cero con Agentic Racing. Cómo se traduce un objetivo humano a una recompensa, con la función real del piloto RL del proyecto como caso de estudio: escalas, unidades, recompensas densas y escasas, terminaciones que funcionan como premios, reward shaping, y por qué siete variantes de la recompensa no podían arreglar un problema que no era de recompensa.