Agentic Racing: un piloto que nunca aprendió a manejar, un jefe de equipo que sí aprendió a razonar
Construí un demo de carreras donde un piloto reactivo obedece a un jefe de equipo LLM que razona por evento. Ocho intentos de entrenar el piloto con aprendizaje por refuerzo no funcionaron —la pista estaba rota antes que el algoritmo—, y medir cuánto aporta el estratega terminó siendo el experimento más interesante: siete corridas, sesgos de razonamiento reales y parcialmente corregibles, y una lección sobre confiar en el benchmark completo antes que en el test rápido de escritorio.