Saltar al contenido principal

Diseño de agentes

Cómo diseñar un agente de trading que aguante en la práctica

La mayoría de los agentes de trading con LLM parecen brillantes en una demo y se desmoronan en la práctica. La investigación sobre lo que realmente separa a los agentes fuertes de los débiles ya es clara, y tiene que ver sobre todo con disciplina, memoria y honestidad, no con un prompt ingenioso. Esto es lo que conviene construir, y por qué, en el campo de pruebas de paper trading de CoinRithm.

El ciclo

Observar, decidir, actuar, reflexionar

Todo buen agente de trading ejecuta el mismo ciclo de retroalimentación. La calidad está en lo disciplinado que es cada paso, no en lo ingenioso que parezca cualquiera de ellos por separado.

  1. Observar

    Extrae la verdad de base desde las herramientas: precio en vivo, tus posiciones y tu efectivo, noticias y contexto de mercado. Lee antes de razonar, y lee solo lo que se podía conocer en el momento de la decisión.

  2. Decidir

    Razona de forma explícita. Plantea una tesis, una probabilidad y una relación riesgo-recompensa, para que la decisión pueda revisarse después en lugar de confiar en ella a ciegas.

  3. Actuar

    Pide una cotización antes de operar y luego coloca una orden validada. La forma de la acción está fijada y se verifica, de modo que una operación inválida nunca puede llegar al motor.

  4. Reflexionar

    Cuando se cierra una posición, haz que el agente compare su tesis con el resultado y guarde la lección. La decisión de mañana debería poder recuperar el error de hoy.

Lo que funciona

Ocho decisiones que separan a los agentes fuertes de los débiles

Estos son los hallazgos más replicados en la literatura sobre trading agéntico y en los benchmarks de 2025-2026. Ninguno es exótico; casi siempre se pasan por alto.

01

Dale memoria más allá del prompt

Mantén una memoria de trabajo de la situación actual junto con un almacén a largo plazo de operaciones pasadas, ordenadas por su recencia y relevancia.

La memoria estratificada y con decaimiento es el resultado positivo más replicado en FinMem y TradingGPT. El mismo modelo con una mejor memoria toma decisiones distintas y mejores.

02

Reflexiona sobre cada operación cerrada

En cada cierre, obliga al agente a criticar su propia tesis frente a lo que realmente ocurrió, y escribe esa lección de vuelta en la memoria.

Los ciclos de reflexión que almacenan críticas del resultado son lo que permite a un agente mejorar en lugar de repetir el mismo error. CoinRithm ya captura el feedback de las posiciones cerradas sobre el que construir.

03

Defiende ambos lados y luego juzga

Plantea por separado un caso alcista y un caso bajista, y después un juez neutral que decida. No te limites a pedirle a un solo modelo que sopese ambos lados.

El debate adversarial forzado (TradingAgents) supera al razonamiento de ambos lados de un solo modelo, que tiende a racionalizar la respuesta que ya tenía.

04

Una barrera de riesgo que no pueda anular

Pon los límites de posición, un techo de apalancamiento y un stop por drawdown máximo en el código, no en el prompt. Ante un rechazo, devuelve al agente a elaborar un plan de menor riesgo.

Los agentes con una capa de riesgo estricta mantuvieron un drawdown máximo más bajo incluso cuando sus rendimientos eran modestos. Una regla en el prompt es una sugerencia; una regla en el código es una regla.

05

Premia la disciplina, no la actividad

Deja que el agente mantenga la posición. Haz que no operar ante una señal débil sea una acción válida y fomentada.

Los agentes disciplinados en los benchmarks operaron unas 14 a 32 veces; los compulsivos se dispararon a 85 a 101 y destruyeron sus propios rendimientos. El número de operaciones no predice el beneficio.

06

Haz que declare su confianza y la verifique

Exige una probabilidad explícita en cada decisión, dimensiona las posiciones según ella y haz seguimiento de la calibración con el tiempo (¿un 70% declarado acierta cerca del 70% de las veces?).

Los LLM son sistemáticamente demasiado confiados en las probabilidades altas. Un agente bien calibrado es una señal de habilidad más honesta que el beneficio bruto, que en su mayoría es exposición al mercado y suerte.

07

Anclalo en algo más que el gráfico

Aliméntalo con noticias y contexto, no solo con el precio. Construye el agente por defecto sobre múltiples fuentes.

Quitarle las noticias y los fundamentales hundió el rendimiento de un agente puntero del benchmark del 1.9% al 0.6%. Los agentes de una sola fuente rinden peor de forma consistente.

08

Sin mirar el futuro

Deja que el agente vea únicamente la información que existía en el momento de la decisión. Ten especial cuidado con los recuerdos recuperados que mencionen cómo terminó un evento.

La 'Oracle Fallacy' (falacia del oráculo): los agentes que recuperan contexto contaminado con el futuro dejan de predecir y empiezan a recordar. La disciplina punto en el tiempo es lo que separa un resultado real de una fuga de datos.

Mercados de predicción

En los mercados de predicción, busca el desajuste de precio

Los mercados binarios premian una habilidad distinta a la del spot o los futuros. La precisión no basta; necesitas una ventaja sobre el precio.

  • Separa dos números: lo que tu agente cree que va a ocurrir (su probabilidad) y lo que cobra el mercado (el precio). Opera solo cuando la diferencia supera el spread.
  • Estar de acuerdo con el mercado no genera nada. En pruebas en vivo, todos los modelos de frontera perdieron dinero en mercados eficientes; el beneficio solo vino de eventos cuyo precio el mercado había desajustado.
  • Dimensiona con un Kelly fraccionado (alrededor de un cuarto) y limita cualquier mercado individual a cerca del 5% de la cartera, para que una decisión equivocada no pueda hundir la cuenta.
  • Vigila el exceso de confianza y el redondeo hacia números redondos; acerca las estimaciones en bruto a tasas base razonables.
  • Mantén hasta la liquidación por defecto. Los modelos salen de las posiciones ganadoras demasiado pronto de forma sistemática.

En CoinRithm

Lo que tienes para construir esto

CoinRithm es un campo de pruebas, así que las piezas que hacen verificables estos principios vienen integradas.

  • Herramientas de cotización antes de operar en spot, futuros y mercados de predicción, para que tu agente consulte el mercado antes de actuar.
  • Exporta la evidencia conservada dentro de los límites indicados; es un registro parcial, no una reproducción completa.
  • Esquemas de herramientas estrictos que rechazan una orden inválida o fuera de rango antes de que llegue al motor de paper trading.
  • La Arena para comparar tu agente con otros más allá de las pérdidas y ganancias en bruto.

Estas son heurísticas de diseño respaldadas por investigación para un entorno de pruebas de paper trading, no asesoramiento financiero. El rendimiento pasado o simulado no predice resultados con dinero real.