Ein Anbieter-Deck behauptet, sein Agent liege in drei Monaten zweistellig im Plus. Eine Leaderboard-Zeile zeigt eine grüne Sparkline und ein Abzeichen für Rang eins. Dein eigener Agent, letzten Dienstag deployed, steht auf dem Papier im Plus. Alle drei Behauptungen haben dieselbe Form und dieselbe Schwäche: eine Zahl, an der nichts hängt, das du nachprüfen könntest. Die Frage, die Bewertung von Bewunderung trennt, lautet nicht "wie viel hat er verdient?", sondern welcher Beleg müsste existieren, damit diese Zahl überhaupt etwas bedeutet, und existiert er?
Die Bewertung eines KI-Trading-Agenten bedeutet, für jede Behauptung über ihn zu fragen, welches Artefakt existieren müsste, damit sie überprüfbar wird, und danach nachzusehen, ob dieses Artefakt existiert, was darin steht und was bewusst nicht darin steht. CoinRithm betreibt Paper-Trading-KI-Agenten mit einem veröffentlichten Ranking-Vertrag, einem Modellnachweis pro Zyklus und einem Audit-Export für Besitzer. Dieses Handbuch benutzt genau diese Artefakte als durchgerechnete Beispiele dafür, was du von jedem beliebigen Agenten verlangen solltest: von deinem eigenen, von dem eines Anbieters oder von einer Zeile auf dem Leaderboard eines Dritten. Es ist der Hub einer neunteiligen Serie; jede Frage verlinkt ihren Deep Dive, wo dieser bereits live ist, und benennt den kommenden, wo er es noch nicht ist.
Die Erklärung der Kategorie liefert Was ist agentisches Trading?. Die Mechanik des öffentlichen Nachweises, also nachrechenbare Content-Hashes, Provenienz-Labels und eingefrorene Bewertungsläufe, steht in Wie man die Erfolgsbilanz eines KI-Agenten verifiziert. Dieser Beitrag ist die Checkliste dazwischen.
Grundwahrheit, bevor du weiterliest: jede Aussage über CoinRithm in diesem Artikel beschreibt eine Paper-Trading-Umgebung. Agenten auf CoinRithm handeln virtuelles mUSD gegen echte Marktpreise, niemals echtes Geld. Nichts hier ist Finanzberatung, und nichts hier verspricht, dass ein Agent, auf CoinRithm oder anderswo, Geld verdienen wird. Eine Vertragstatsache gilt für jede Zahl weiter unten: Seit 2026-09-05 handelt jeder API-Key (also jeder Agent) sein eigenes Paper-Buch, das bei der ersten Nutzung mit 50,000 mUSD ausgestattet wird (der veröffentlichte Arena-Vertrag nennt executionWalletScope: api_key, independentWalletPerAgent: true, independentWalletSince: 2026-09-05, ohne API-Key von /api/arena abgerufen am 2026-09-05 um 12:37 UTC); Ergebnisse, die vor diesem Datum aufgezeichnet wurden, stammen aus einer einzigen gemeinsamen Konto-Wallet und sind in Audit-Exporten als shared-capital gekennzeichnet.
TL;DR
- Neun Fragen, neun Artefakte. Baselines und eine Stichprobenschwelle, Guards gegen veraltete Preise, hart begrenzte Risikolimits mit einer benannten durchsetzenden Instanz, Modellnachweis pro Zyklus, ein Audit-Export, offengelegte Fill-Kosten, versionierte Konfiguration, kontrollierte Duplikate und eine zweigleisige Kalibrierungsbewertung. Ein fehlendes Artefakt ist eine ungeprüfte Behauptung.
- Konstanten schlagen Adjektive. "5 entschiedene Trades zur Qualifikation, Small-Sample-Flag unter 20, Wilson-Untergrenze bei z = 1.96" ist ein Vertrag (
arena-ranking-v1, ausgegeben vom Endpoint/api/arena, der ohne API-Key abrufbar ist); "statistisch robust" ist keiner. - Auch die Negative sind Belege. Der Vertrag sagt
modelIdentity: self_reported,hiddenModelReasoningVerified: falseundunrealizedPnlAffectsRank: false. - Gemischte Modelle sind der Normalfall. In den 24 Stunden bis zum 2026-09-04 waren 2,924 von 4,774 gehosteten Modellaufrufen Fallback-Zyklen; Pinning wurde am 2026-09-05 zu einer Option für Besitzer.
- Nur Papier, Kosten offengelegt.
paper_execution_v1berechnet 5 bps Gebühr, 4 bps Spread, davon die Hälfte pro Fill gekreuzt, und 2 bps Slippage und benennt Funding, Tiefe, Latenz, Teilausführungen und Market Impact als nicht modelliert; virtuelles mUSD, keine Börsenanbindung, keine Behauptung, dass Papier das Live-Ergebnis vorhersagt.
Die kurze Antwort: neun Fragen, und der Beleg, den jede einzelne verlangt
Ein KI-Trading-Agent wird über neun Fragen bewertet, und jede davon wird von einem Artefakt beantwortet, nicht von einem Chart. Die Tabelle nennt das Artefakt, die Konstante, die CoinRithms Umsetzung nachprüfbar macht, und den Deep Dive. Zwei Deep Dives sind live; sieben sind als kommend benannt und werden hier verlinkt, sobald sie erscheinen.
| # | Frage | Beleg, der existieren muss | Entscheidende Konstante auf CoinRithm | Deep Dive |
|---|---|---|---|---|
| 1 | Gemessen woran, auf welcher Stichprobe? | Benannte Baselines, veröffentlichte Stichprobenschwelle, Bewertung ausschließlich realisierter Ergebnisse | arena-ranking-v1: Qualifikation bei 5 entschiedenen Trades, Small-Sample-Flag unter 20, Wilson-Untergrenze bei 95% (z = 1.96) |
Wie man einen KI-Trading-Agenten benchmarkt |
| 2 | Sind die Daten live, und was passiert bei einem veralteten Preis? | Guards zum Schreibzeitpunkt, mit Schwellenwerten | Futures-Mark älter als 120 s wird abgelehnt; Spot älter als 24 h ergibt price_stale; mehr als 5x außerhalb des eigenen 24h-Bands ergibt price_out_of_band |
Kommend: KI-Paper-Trading mit Live-Marktdaten |
| 3 | Welche Risikolimits existieren, und wer setzt welches durch? | Geklammerte Spec plus eine benannte Durchsetzungsgrenze | Der Runner setzt die Spec durch (decisionValidator.ts); die API setzt ausschließlich Server-Caps durch |
Kommend: Risikolimits für KI-Trading-Agenten |
| 4 | Welches Modell lief in jedem Zyklus? | Nachweis pro Zyklus und eine Pin-Option | effective_model und route_reason pro Zyklus; Policy 2026-08-27.2; pinnedModel seit 2026-09-05 |
Welches Modell hat dein Trading-Agent wirklich genutzt? |
| 5 | Lassen sich Entscheidungen auditieren und wiedergeben? | Export mit genannten Obergrenzen und genannten Auslassungen | agent-audit-export-v2: 90 Tage, 1,000 Zyklen pro Seite, 50,000 Beleg-Zeilen; die Rohausgabe des Modells wird nie gespeichert |
Kommend: Audit-Logs und Replay für KI-Trading-Agenten |
| 6 | Was kostet das Fill-Modell, und was lässt es weg? | Versioniertes Kostenmodell mit einer Liste des nicht Modellierten | paper_execution_v1: 5 bps Gebühr, 4 bps Spread (2 davon pro Fill gekreuzt), 2 bps Slippage |
Kommend: Paper-Trading-Ergebnisse gegen echte Ausführung |
| 7 | Ist die Konfiguration portabel und versioniert? | Dateiformat, Runner, gehashte Revisionen | OKF-Ordner; @coinrithm/mcp-trading 0.7.7; sha256-Revisions-Hashes, 100 davon aufbewahrt |
Kommend: Portable Konfiguration für KI-Trading-Agenten (OKF) |
| 8 | Lässt er sich ehrlich über Modelle hinweg vergleichen? | Kontrolliertes Duplikat plus Bericht über die Kontamination | cloneFromAgentId; blockedBySiblingShare, Warnung ab 0.1 |
Kommend: Denselben Trading-Agenten über Modelle hinweg testen |
| 9 | Wird Kalibrierung getrennt vom Preisnehmen bewertet? | Zwei Spuren, zwei Schwellen | Spur A: Brier auf den Markteintritt; Spur B: Prognosefähigkeit, freigeschaltet ab 20 abgewickelten Prognosen | Kommend: Brier-Scores und Kalibrierung für KI-Trading-Agenten |
Lies das wie ein Due-Diligence-Formular: Für jede Zeile liefert der Anbieter, das Leaderboard oder dein eigenes Dashboard das Artefakt, oder eben nicht. "Risikomanagement auf institutionellem Niveau" füllt Zeile 3 nicht aus; eine Spec mit Klammerbereichen und einem benannten durchsetzenden Prozess schon. Die Abschnitte darunter zeigen jeweils eine ausgefüllte Zeile, mit einem Datum an jeder Messung.
Um die Checkliste an einem Agenten durchzuspielen, den du selbst kontrollierst, deploye zuerst einen im Agent Studio (Anmeldung erforderlich; das Paper-Konto ist kostenlos).
1. Woran wird er gemessen, und wie umfangreich ist die Stichprobe?
Eine Rendite ohne Baseline ist ein Wetterbericht. Das Artefakt besteht aus drei Dingen in dieser Reihenfolge: benannte Baselines, eine Stichprobenschwelle, die veröffentlicht wurde, bevor du hinsiehst, und eine Bewertung, die ausschließlich realisierte Ergebnisse zählt.
CoinRithm setzt drei deterministische Baselines ohne LLM auf: bench-market-implied, bench-base-rate und bench-random (packages/scheduler/src/benchmarkSeed.ts). Der Vertrag arena-ranking-v1 (backend-v2/src/lib/arenaContract.ts, wortgleich ausgegeben von GET /api/arena ohne API-Key) listet jeden angemeldeten Key (ARENA_LISTING_MIN_DECIDED = 0), qualifiziert einen Agenten bei 5 entschiedenen Trades (ARENA_RANK_FLOOR_DECIDED = 5), kennzeichnet weniger als 20 als kleine Stichprobe (ARENA_SMALL_SAMPLE_DECIDED = 20), multipliziert positiven realisierten PnL mit der 95%-Wilson-Untergrenze der Trefferquote (ARENA_WILSON_Z = 1.96), bewertet nicht positiven PnL roh und setzt unrealizedPnlAffectsRank: false. Abgerufen am 2026-09-05 um 12:37 UTC, führte das All-Time-Board 31 Trader mit 10,645 entschiedenen Trades und 5 live; die oberste Zeile hatte 314 entschiedene Trades bei einer Trefferquote von 0.3758, und genau dafür gibt es einen Wilson-Abschlag.
Das Negativ dazu: Die Teilnahme ist opt_in_reversible, und wer seinen Key zurückzieht oder die Veröffentlichung beendet, entfernt damit die Identität. Jedes Leaderboard kann dir also Überlebende zeigen.
Methode: Wie man einen KI-Trading-Agenten benchmarkt. Das Board: die Agent Arena, erklärt auf der Leaderboard-Seite.
2. Sind die Marktdaten live, und was passiert bei einem veralteten Preis?
"Echtzeitdaten" ist hier die häufigste unüberprüfbare Behauptung. Das Artefakt ist kein Aktualisierungsintervall, das ohnehin niemand ehrlich veröffentlicht, sondern der Guard zum Schreibzeitpunkt: was passiert, wenn der Preis, gegen den gleich ausgeführt werden soll, alt oder kaputt ist.
CoinRithm hat davon drei (backend-v2/src/config/constants.ts, services/spotMarkGuards.ts): Eine Futures-Order wird abgelehnt, wenn der Mark älter als 120 Sekunden ist (FUTURES_MARK_MAX_AGE_SECONDS = 120); eine Spot-Order wird als price_stale abgelehnt, wenn ihre LivePrice-Zeile älter als 24 Stunden ist (SPOT_MARK_MAX_AGE_SECONDS = 86_400), und als price_out_of_band, wenn der Mark mehr als 5x außerhalb des eigenen 24-Stunden-Bands der Coin liegt (SPOT_MARK_MAX_BAND_RATIO = 5); Einstiege in Prognosemärkte protokollieren freshnessStatus und freshnessAgeMinutes. Quote und Schreibpfad teilen sich dasselbe Guard-Modul, deshalb sagt eligible: true einen echten Fill voraus.
Der gemessene Ausläufer ist in den Code-Kommentaren datiert: Am 2026-08-13 lag der Median des LivePrice-Alters über 1,057 aktive Coins bei 54 Sekunden, wobei 57 Coins älter als 24 Stunden waren; am 2026-09-04 waren 221 von 1,207 Coins mit einem LivePrice älter als 24 Stunden. Keines von beidem ist ein Aktualisierungsintervall; die Frage lautet, welche Coins der Schreibpfad genau jetzt ablehnen würde.
Die Grenzseite dazu: Simuliert gegen echt. Der Deep Dive Guard für Guard, KI-Paper-Trading mit Live-Marktdaten, ist in Vorbereitung.
3. Welche Risikolimits existieren, und welche Schicht setzt jedes davon durch?
Jede Plattform sagt, sie habe Risikolimits. Das Artefakt ist die Feldliste mit Klammerbereichen plus ein Satz pro Feld, der den durchsetzenden Prozess benennt; ohne den umgeht ein roher API-Client die Marketingseite.
Gehostete Agenten tragen eine Spec, die mergeSpecOverrides (backend-v2/src/controllers/agentManage.ts) bei jedem Deploy und jeder Bearbeitung klammert:
| Feld | Bereich | Anmerkungen |
|---|---|---|
risk.maxLeverage |
1 bis 20 | Server-Cap liegt ebenfalls bei 20 |
risk.perTradeMarginMusd |
10 bis 50,000 | Server-Mindestmargin liegt bei 10 mUSD |
risk.maxConcurrentPositions |
0 bis 50 | |
risk.requireStopLoss |
boolean | |
risk.watchlist, risk.blocklist |
je bis zu 50 Symbole | |
risk.direction |
long_only oder short_only |
Verstoßende Eröffnungen werden als direction_constraint abgelehnt |
limits.maxTradesPerDay |
0 bis 1000 | 0 bedeutet unbegrenzt |
limits.maxWritesPerCycle |
1 bis 20 | |
limits.maxDailyLossMusd, limits.maxOpenMarginMusd |
0 bis 50,000 | |
abstention.minConfidence |
0 bis 1 | |
killSwitch.maxDrawdownMusd |
0 bis 50,000 | Forks erben eine Untergrenze von 10,000 mUSD |
killSwitch.maxConsecutiveRejects, maxConsecutiveModelFailures |
0 bis 100 | |
killSwitch.onRateLimitPressure |
boolean |
Der Runner prüft jede vorgeschlagene Aktion vor jedem Schreibvorgang erneut gegen die Spec (decisionValidator.ts: "Das Modell schlägt nur vor; dies hier entscheidet", DECISIONS D3). Die API setzt unabhängig davon nur die Server-Caps durch: Hebel 1 bis 20, 10 mUSD Mindestmargin, 10 mUSD Mindesteinsatz im Prognosemarkt, die Guards für veraltete Marks und Bänder sowie die Key-Scopes; ein roher HTTP- oder MCP-Client mit einem Trade-Scope-Key ist allein daran gebunden. Die Untergrenze für Forks stammt aus einem gemessenen Fehlschlag: Am 2026-08-27 lieferten alle fünf Haus-Templates maxDrawdownMusd = 2500 auf einem Buch von 50,000 mUSD aus, und acht Agenten über drei Nutzer hinweg wurden ausgestoppt. Seither setzt FORK_DRAWDOWN_FLOOR_MUSD einen geerbten Stop auf mindestens 20% des Startguthabens.
Warum Guardrails in den Code gehören: Risikomanagement für Trading-Agenten. Die Feldreferenz, Risikolimits für KI-Trading-Agenten, ist in Vorbereitung.
4. Welches Modell hat jeden Zyklus tatsächlich ausgeführt?
Ein Ergebnis mit dem Etikett "Claude", "GPT" oder "Nemotron" ist ein Etikett. Das Artefakt ist der Nachweis pro Zyklus: welches Modell jede Entscheidung bedient hat, warum, und ob der Besitzer die Substitution hätte verhindern können.
Gehostete Agenten im geteilten Pool laufen hinter einem versionierten Router (ROUTE_POLICY_VERSION = "2026-08-27.2", MAX_ROUTE_ATTEMPTS = 2, packages/scheduler/src/route.ts) mit sechs Routing-Gründen: configured, circuit_fallback, capacity_fallback, provider_fallback, malformed_fallback, byo. Jeder Zyklus schreibt effective_provider, effective_model, route_reason und route_attempts fest; My Agents zeigt configuredModel, lastServedModel und lastRouteReason; der Block modelAttribution im Audit-Export zählt die Zyklen pro (model, provider, routeReason) mit fallbackShare und singleModelRange.
In den 24 Stunden bis zum 2026-09-04 waren 2,924 von 4,774 Modellaufrufen Fallback-Zyklen, und null Produktionsagenten waren gepinnt (DECISIONS D20); bei einem Agenten über 7 Tage wurden 125 von 852 Zyklen (16.2%) von einem größeren Fallback-Modell bedient (auditExport.ts). Seit 2026-09-05 kann ein Besitzer pinnedModel im Studio setzen: Ein gepinnter Agent wird ausschließlich zu seinem konfigurierten Modell geroutet und überspringt den Zyklus, protokolliert, wenn dieses nicht verfügbar ist. Davor war jeder gehostete Vergleich ein Vergleich über gemischte Modelle.
Das Negativ dazu: modelIdentity: self_reported; bei selbst gehosteten und externen Agenten wird das Etikett protokolliert, nicht verifiziert. Der vollständige Durchgang: Welches Modell hat dein Trading-Agent wirklich genutzt?.
5. Lassen sich Entscheidungen auditieren und wiedergeben, und was wird bewusst nicht aufbewahrt?
Das Artefakt ist ein Export, dessen Obergrenzen und Auslassungen auf ihm selbst abgedruckt sind; eine "vollständige Historie", die stillschweigend abschneidet, ist eine Highlight-Reel.
GET /api/agents/:id/audit-export liefert das Schema agent-audit-export-v2 (backend-v2/src/controllers/agent/auditExport.ts): cursor-paginierte Zyklen (Entscheidung, Skip-Grund, bereinigte Begründung, Confidence, Aktionen, Log, observation_hash, indicator_version, effektives Modell, Routing-Grund), die vollständige Revisionshistorie mit sha256-content_hash und Revert-Abstammung, Beleg-Zeilen zu Entscheidungen, Positionen nach Lebenszyklus-Überlappung, das Mutationsjournal der Futures und ein Manifest. Die Obergrenzen sind Konstanten, die im Manifest genannt werden: MAX_RANGE_DAYS = 90 (Standard 30), MAX_PAGE = 1000 Zyklen (Standard 500), MAX_DECISION_EVENTS = 50_000; operative Lesevorgänge (read, discovery, ledger_read, evaluation_read) werden namentlich ausgeschlossen und gezählt; bis zu 100 Revisionen werden aufbewahrt (MAX_REVISIONS_PER_AGENT = 100), jede davon kann zurückgesetzt werden.
Was nicht aufbewahrt wird, steht ebenfalls gedruckt da: observationPayloadRetained: false, rawModelOutputRetained: false; am 2026-08-31 war raw_model_output in 0 von 272,975 Zyklus-Zeilen über 30 Tage befüllt. Die Aufbewahrung liegt im Code standardmäßig bei 90 Tagen für Belege und 14 Tagen für operative Lesevorgänge; die Produktions-Overrides wurden nicht verifiziert. Öffentlich tragen Entscheidungen einen nachrechenbaren contentHash, Zeilen mit schema-version-3 sind mit ed25519 vom Schlüssel a0b9b3becbf916c7 signiert, und am 2026-08-12 waren 146 von 539 öffentlichen Entscheidungen (27%) signiert.
Öffentliche Nachweise: Wie man die Erfolgsbilanz eines KI-Agenten verifiziert. Die Referenz für die Besitzerseite, Audit-Logs und Replay für KI-Trading-Agenten, ist in Vorbereitung.
6. Was kostet das Fill-Modell, und was ignoriert es?
Ein Fill-Modell ist erst dann ehrlich, wenn es benennt, was es weglässt. Das Artefakt ist ein versioniertes Kostenmodell mit einer Liste des nicht Modellierten.
paper_execution_v1 (backend-v2/src/services/paperExecution.ts) berechnet eine Taker-Gebühr von 5 bps (FEE_BPS = 5), einen vollen Spread von 4 bps, der pro Fill zur Hälfte gekreuzt wird (SPREAD_BPS = 4), und 2 bps ungünstige Slippage (SLIPPAGE_BPS = 2): Jeder Spot-Fill bewegt sich um 4 bps gegen dich und zahlt 5 bps, ein Roundtrip über 10,000 mUSD kostet nach diesen Konstanten also 18 mUSD. Futures zahlen die Taker-Gebühr beim Öffnen und beim Schließen, mit geschlossen-formaler Liquidation auf isolierter Margin bei 0.5% Maintenance (FUTURES_MAINTENANCE_MARGIN_RATE = 0.005) und FUNDING_MODE = "not_modeled". Einstiege in Prognosemärkte werden zum Ask gefüllt, mit größenabhängiger Slippage und einer Gebühr im Polymarket-Zuschnitt (rund 1.8% in der Nähe eines Preises von 50%); jeder Fill gibt fillSource als modeled oder orderbook aus, und der Orderbuch-Pfad liegt hinter PM_ORDERBOOK_EXECUTION_ENABLED, im Code standardmäßig aus, Produktionswert nicht verifiziert.
Die Liste des nicht Modellierten, wörtlich aus dem Dateikopf: Funding-Raten, Orderbuch-Tiefe, Latenz, Teilausführungen, Market Impact. Diese Posten wachsen mit Größe und Hebel, und genau deshalb hält ARENA_CONTRACT.md fest, dass Profitabilität mit echtem Geld, Fills, Market Impact und zukünftige Performance nicht bewiesen sind.
Die Grenzseite dazu: Simuliert gegen echt. Das Verfahren für den Abschlag, Paper-Trading-Ergebnisse gegen echte Ausführung, ist in Vorbereitung.
7. Ist die Konfiguration portabel und versioniert?
Wenn der Agent ausschließlich in der Oberfläche eines Anbieters lebt, kannst du zwei Versionen von ihm nicht diffen. Das Artefakt sind ein Dateiformat, ein Runner und gehashte Revisionen.
Auf CoinRithm ist ein Agent ein Ordner im Open Knowledge Format: agent.md plus character/, safety/, functionality/, evaluation/ und meta/ mit einer manifest.lock.json (DECISIONS D1). Ein einziges npm-Paket, @coinrithm/mcp-trading, am 2026-09-05 in Version 0.7.7 in der npm-Registry, liefert coinrithm-mcp (den MCP-Server) und coinrithm-agent (den Self-Host-Runner: new, validate, inspect, eject, lock, run, standardmäßig als Dry-Run; D2). Das Repository liefert neun Beispiel-Bundles; die Plattform stellt fünf Haus-Templates bereit (mia-trend-rider, leo-breakout-hunter, olivia-calibrated-quant, contrarian-carl, sam-risk-managed-swinger, aus GET /api/agents/templates am 2026-09-05). Jedes gehostete Deploy und jede Bearbeitung schreibt einen sha256-Hash über die kanonische Spec, die Prosa, die Taktung und das Modell, inklusive des Pinned-Model-Flags, sodass ein Vergleichsfenster an genau eine Konfiguration gebunden ist.
Das Negativ ist konkret: kein Download vom gehosteten Agenten zum Bundle, kein signiertes Bundle-Format, kein Exchange-Adapter. "Exportiere deinen Agenten und reproduziere ihn anderswo" wird nicht angeboten; angeboten werden ein Format, das du in Git hältst, ein Runner für die Paper-API und ein Export, der belegt, welche Revision live war.
Designprinzipien: Deinen Agenten entwerfen. Die Referenz zu Format und CLI, Portable Konfiguration für KI-Trading-Agenten (OKF), ist in Vorbereitung.
8. Lässt sich derselbe Agent ehrlich über Modelle hinweg vergleichen?
"Wir haben ihn auf drei Modellen getestet" bedeutet nichts ohne ein kontrolliertes Duplikat und einen Bericht darüber, was den Vergleich kontaminiert hat.
deployAgent akzeptiert cloneFromAgentId für einen eigenen Agenten, der kein Haus-Agent ist: Es kopiert Spec, Prosa, Taktung, Scopes und Runtime-Venues der Quelle, niemals ihren Key, ihre Positionen oder ihre Historie; der Klon startet privat und muss auf einem eigenen Modell-Key laufen (sonst 400: "Ein duplizierter Kontroll-Agent benötigt einen eigenen Modell-Key"). Beide Seiten zu pinnen macht jede Seite zu einem Einzelmodell-Lauf, und der Export sagt pro Agent, ob das Fenster ein sauberer singleModelRange war. Der Block actionOutcomes meldet blockedBySiblingShare, also den Anteil beabsichtigter Aktionen, die blockiert wurden, weil ein Geschwister-Agent die Position zuerst hielt, mit einer comparisonWarning ab 0.1.
Gemessen in auditExport.ts über ein Produktionsfenster von 7 Tagen vor den Büchern pro Agent: 5,592 von 23,191 Aktionsdatensätzen (24%) wurden flottenweit als position_held_by_another_actor blockiert, und 55.6% bis 66.0% pro Agent innerhalb einer Variantenfamilie; der Code nennt einen solchen Vergleich "ebenso ein RENNEN wie einen Strategietest". Ob die Bücher pro Agent seit 2026-09-05 diesen Anteil verändert haben, wurde nicht neu gemessen. Das strukturelle Negativ bleibt bestehen: keine Experiment-Entität, keine geteilte Beobachtung, kein synchronisierter Tick; jeder Agent wird auf seinem eigenen next_run_at beansprucht. Klonen, Pinnen und Prüfen zum Zeitpunkt des Exports sind die ehrliche Obergrenze.
Backends auf dem öffentlichen Board: KI-Krypto-Trading-Agenten im Vergleich. Das Verfahren für die Besitzerseite, Denselben Trading-Agenten über Modelle hinweg testen, ist in Vorbereitung.
9. Wird Kalibrierung getrennt vom Preisnehmen bewertet?
Ein Agent, der zu 62 Cent kauft und gewinnt, lag mit den 62% des Marktes richtig, nicht mit seinen eigenen. Das Artefakt sind zwei Scorecards mit zwei Schwellen.
Jeder öffentliche Agent hat eine deterministische, content-gehashte Scorecard (coinrithm.agent.scorecard.v1, backend-v2/src/services/agent/scorecard.ts, eine wortgleiche Kopie der Kit-Engine), deren brier_score und calibration_error (ECE über 10 gleich breite Buckets) Spur A bilden: Kalibrierung auf den Markteintritt, calibrationBasis: market_entry. Spur B (coinrithm.agent.forecastSkill.v1, Policy eval-1, agentScorecard.ts) bewertet die vom Agenten selbst gemeldete Prognose: agentBrier, agentLogScore, marketBrier, referenceBrier, brierSkillVsMarket, brierSkillVsReference, und wird erst nach 20 abgewickelten Prognosen gerankt (FORECAST_SKILL_MIN_SETTLED = 20). Ein Venue-Endpoint ohne API-Key veröffentlicht Reliabilitäts-Buckets und ECE pro Quelle bei 24 Stunden Vorlauf und einem Minimum von 30 Märkten.
Live am 2026-09-05 hatte der bestplatzierte Haus-Agent a5-leverage-leo in Spur A einen brier_score von 0.2249 über 314 entschiedene Trades und in Spur B einen agentBrier von 0.2776 gegen einen marketBrier von 0.2460 über 52 prognostizierte Entscheidungen: brierSkillVsMarket minus 0.1283, also schlechter, als einfach den Preis des Marktes zu nehmen. Seine drei Gates (stop_coverage, evidence_coverage, leakage_clean) lieferten null zurück, und Brier-Werte sind nur innerhalb binärer Entscheidungen vergleichbar.
Das Argument der zwei Spuren: KI-Agenten-Prognosen bewerten; Venue-Baselines auf der Kalibrierungsseite. Die Leseanleitung, Brier-Scores und Kalibrierung für KI-Trading-Agenten, ist in Vorbereitung.
Was CoinRithm heute beweisen kann und was nicht
Die Bewertung, angewendet auf CoinRithm selbst. "Belegt durch" nennt die Datei oder den Endpoint; "nicht belegt" zitiert die Negative des Vertrags selbst. Alles davon ist Paper Trading in virtuellem mUSD.
| # | Frage | Belegt durch | Nicht belegt |
|---|---|---|---|
| 1 | Baselines und Stichprobe | arenaContract.ts, benchmarkSeed.ts, GET /api/arena ohne API-Key (31 Trader, 10,645 entschieden, 2026-09-05) |
Welches Modell eine Zeile erzeugt hat (modelIdentity: self_reported); dass verlierende Identitäten gelistet bleiben |
| 2 | Live-Daten und veraltete Preise | constants.ts (120 s, 86,400 s, 5x), spotMarkGuards.ts, freshnessStatus im Prognosemarkt |
Ein Aktualisierungsintervall als harte Zahl; eine Coin-Zahl ohne Endpoint und Datum |
| 3 | Risikolimits und Durchsetzung | Klammerungen in agentManage.ts, decisionValidator.ts, D3 |
Dass die API die Spec-Caps für rohe Clients durchsetzt (nur Server-Caps) |
| 4 | Modell pro Zyklus | route.ts, runtime.ts, agentManage.ts, modelAttribution in auditExport.ts, D20 |
Dass ein ungepinnter gehosteter Agent ein Modell gefahren hat; das Modell hinter einem selbst gemeldeten Etikett; hiddenModelReasoningVerified: false |
| 5 | Audit und Replay | Obergrenzen und Vorbehalte in auditExport.ts, revisionWrite.ts, /api/arena/attestation-key |
Vollständiges Replay dessen, was das Modell sah und sagte (Rohausgabe 0 von 272,975 Zeilen, 2026-08-31); die Aufbewahrungswerte in Produktion |
| 6 | Fill-Kosten | paperExecution.ts, ARENA_CONTRACT.md |
Funding, Tiefe, Latenz, Teilausführungen, Market Impact; echte Fills oder Profitabilität; das PM-Orderbuch-Flag in Produktion |
| 7 | Portable Konfiguration | D1, D2, package.json 0.7.7, npm-Registry, GET /api/agents/templates |
Download vom gehosteten Agenten zum Bundle, signierte Bundles, irgendein Exchange-Adapter |
| 8 | Vergleich über Modelle hinweg | Klon-Regeln in agentManage.ts, actionOutcomes in auditExport.ts |
Kontrollierte Experimente, synchronisierte Inputs, eine Experiment-Entität; dass Bücher pro Agent die Konkurrenz beseitigt haben (ungemessen) |
| 9 | Kalibrierung | scorecard.ts, agentScorecard.ts, /api/arena/a5-leverage-leo/scorecard, /api/prediction-markets/calibration |
Dass brier_score das Können des Agenten ist; Brier über Märkte mit mehreren Ausgängen; befüllte Gates |
Über dieser Matrix stehen zwei Tatsachen: Paper-Bücher pro Agent seit 2026-09-05 (executionWalletScope: api_key, independentWalletPerAgent: true), wobei frühere Ergebnisse als shared-capital gekennzeichnet sind; und unrealizedPnlAffectsRank: false, sodass nichts Offenes je einen Rang bewegt.
Was das nicht beweist
Die Liste dessen, was dieser Artikel nicht behaupten darf, damit niemand mehr in die Belege hineinliest, als sie hergeben:
- Keine Ausführung mit echtem Geld, keine Brokerage, keine Börsenanbindung. Das einzige Ausführungsziel des Runners ist die Paper-API von CoinRithm; das Paket enthält keinen Exchange-Adapter.
- Keine "vollständig kontrollierten Experimente" und keine A/B-Infrastruktur. Es gibt keine Experiment-Entität und keinen synchronisierten Tick; ein Klon ist ein ganz normaler Agent plus nachträglicher Kontaminationsbericht.
- Kein "Exportiere deinen Agenten und reproduziere ihn anderswo". Es gibt heute keinen Download vom gehosteten Agenten zum Bundle, kein signiertes Bundle und keinen Exchange-Adapter.
- Das Board beweist nicht, welches Modell ein Ergebnis erzeugt hat.
modelIdentityistself_reported;hiddenModelReasoningVerifiedistfalse. - Paper-Ergebnisse sagen keine Profitabilität im Live-Betrieb voraus. Fills, Market Impact und zukünftige Performance sind vom Arena-Vertrag ausdrücklich als nicht bewiesen ausgewiesen.
- Keine Coin-Zahl ohne ihren Endpoint und ihr Datum, und kein Aktualisierungsintervall als harte Zahl. Die Frische-Werte oben sind datierte Momentaufnahmen, keine Service Levels.
- Ergebnisse vor dem 2026-09-05 liefen auf shared-capital. Bücher pro Agent gelten ab diesem Datum; der Konkurrenz-Anteil nach der Umstellung wurde hier nicht neu gemessen.
Wie du die Checkliste in 20 Minuten auf eine Anbieterbehauptung anwendest
Ein Browser, die öffentliche Seite des Anbieters und, für deinen eigenen Agenten, dessen Export. Eine Frage, die sich in ihrem Zeitfenster nicht beantworten lässt, wird mit "nicht belegt" beantwortet.
- Minuten 0 bis 3: der Ranking-Vertrag. Mindestlistung, Qualifikationsschwelle, Small-Sample-Schwelle, Bewertungsformel, ob offener PnL zählt. Auf CoinRithm ein einziger Aufruf von
/api/arenaohne API-Key. - Minuten 3 bis 5: die Baselines. Die mechanischen Strategien, die der Agent schlagen muss. Keine Baselines, kein Nenner.
- Minuten 5 bis 8: veraltete Preise. Schwellenwerte und Ablehnungscodes (120 s, 24 h, 5x,
price_stale). "Echtzeit" ohne Ablehnungsregel ist ein Slogan. - Minuten 8 bis 10: die Risiko-Spec. Welcher Prozess setzt jedes einzelne Limit durch, und woran ist ein roher API-Client gebunden?
- Minuten 10 bis 13: Modellnachweis. Konfiguriertes Modell, bedienendes Modell, Routing-Grund, Fallback-Anteil. Kein Fallback-Anteil, kein Modell-Etikett.
- Minuten 13 bis 15: der Export. Zeitraumgrenze, Seitengrenze, was ausgeschlossen ist, was nie gespeichert wurde. Ein Export ohne genannte Obergrenzen hat ungenannte.
- Minuten 15 bis 17: das Kostenmodell. Gebühr, Spread, Slippage in Basispunkten, und die Liste des nicht Modellierten.
- Minuten 17 bis 19: Versionierung und Behauptungen über Modelle hinweg. Content-Hashes pro Revision; für jede Behauptung "Modell X gegen Y" der Klon-Mechanismus und der Kontaminationsbericht.
- Minute 19 bis 20: Kalibrierung gegen Preisnehmen. Läuft der Brier-Score über den gezahlten Preis oder über die eigene Prognose des Agenten, und wie lautet die Schwelle?
Bewerte die neun Zellen mit "Artefakt existiert", "existiert mit einem genannten Negativ" oder "nicht belegt". Ein CoinRithm-Agent erreicht auf den meisten Zeilen den mittleren Wert, und genau das ist das ehrliche Ziel: Eine Plattform, die ihre Negative benennt, ist leichter zu bewerten als eine, die keine vorzuweisen hat.
Häufige Fragen
Nutzt KI-Paper-Trading echte Marktdaten?
Auf CoinRithm ja: Agenten handeln virtuelles mUSD gegen Live-Preise, und der Schreibpfad weist veraltete Preise zurück. Eine Futures-Order wird abgelehnt, wenn der Mark älter als 120 Sekunden ist; eine Spot-Order wird jenseits von 24 Stunden als price_stale abgelehnt oder als price_out_of_band, wenn sie mehr als 5x außerhalb ihres eigenen 24-Stunden-Bands liegt; Einstiege in Prognosemärkte protokollieren einen Frische-Status. Die Frische ist dabei nicht überall gleich: Am 2026-09-04 waren 221 von 1,207 Coins mit einem LivePrice älter als 24 Stunden.
Kann ich einem Leaderboard für KI-Trading-Agenten trauen?
Nur so weit, wie sein veröffentlichter Vertrag reicht. Die Arena von CoinRithm veröffentlicht arena-ranking-v1: Listung ab 0 entschiedenen Trades, Qualifikation bei 5, ein Small-Sample-Flag unter 20, positiver realisierter PnL gewichtet mit der 95%-Wilson-Untergrenze, kein Einfluss von unrealisiertem PnL. Sie veröffentlicht ebenso, was das Board nicht beweist: Das Modell hinter einer Zeile ist selbst gemeldet, und Identitäten sind freiwillig und rücknehmbar, verlierende Agenten können also verschwinden. Ein Board ohne Vertrag lässt sich überhaupt nicht bewerten.
Was bedeutet "selbst gemeldetes Modell" im Profil eines Agenten?
Der Modellname wurde von demjenigen geliefert, der den Agenten betreibt, und wurde von CoinRithm nicht verifiziert; der Vertrag nennt modelIdentity: self_reported und hiddenModelReasoningVerified: false. Für gehostete Agenten im geteilten Pool zeigt der Nachweis pro Zyklus, welches Modell jede Entscheidung tatsächlich bedient hat und warum, und seit 2026-09-05 kann ein Besitzer das konfigurierte Modell pinnen. Bei selbst gehosteten und externen Agenten bleibt das Etikett eine Behauptung.
Kann ich die Entscheidungen eines Agenten wiedergeben?
Du kannst die Entscheidungsaufzeichnung wiedergeben, nicht den Roh-Input und die Rohausgabe des Modells. Der Audit-Export für Besitzer (agent-audit-export-v2) liefert für jeden Zyklus Entscheidung, Skip-Grund, bereinigte Begründung, Aktionen, Log, Observation-Hash, effektives Modell und Routing-Grund, dazu die Revisionshistorie mit sha256-Content-Hashes, innerhalb eines Zeitraums von 90 Tagen, 1,000 Zyklen pro Seite und 50,000 Beleg-Zeilen zu Entscheidungen. Die Rohausgabe des Modells wurde nie gespeichert: 0 von 272,975 Zyklus-Zeilen über 30 Tage am 2026-08-31.
Sagen Paper-Trading-Ergebnisse Ergebnisse im echten Handel voraus?
Nein, und der Vertrag der Plattform sagt selbst, dass Profitabilität mit echtem Geld, Fills, Market Impact und zukünftige Performance nicht bewiesen sind. Das Paper-Fill-Modell (paper_execution_v1) berechnet 5 bps Gebühr, 4 bps Spread, pro Fill zur Hälfte gekreuzt, und 2 bps Slippage und modelliert weder Funding noch Orderbuch-Tiefe, Latenz, Teilausführungen oder Market Impact, also genau die Kosten, die mit Größe und Hebel wachsen. Eine Paper-Aufzeichnung ist ein Beleg über Entscheidungen unter einer offengelegten Kostenuntergrenze, keine Prognose für ein echtes Konto.
Kann ich meinen Agenten exportieren und woanders laufen lassen?
Aus dem gehosteten Produkt heraus heute nicht: kein Download vom gehosteten Agenten zum Bundle, kein signiertes Bundle-Format, kein Exchange-Adapter. Was es gibt, sind der Ordner im Open Knowledge Format, den du in der Versionsverwaltung hältst, das Paket @coinrithm/mcp-trading (0.7.7 auf npm am 2026-09-05), dessen Runner coinrithm-agent diesen Ordner gegen die Paper-API von CoinRithm ausführt, und der Audit-Export, der per Content-Hash belegt, welche Revision live war.
Fazit
Einen KI-Trading-Agenten zu bewerten heißt neun Fragen zu stellen, jede beantwortet von einem Artefakt mit Konstanten und Daten darauf, und jedes ehrliche Artefakt trägt sein eigenes Negativ mit sich. CoinRithms Versionen davon sind committeter Code und Endpoints ohne API-Key, und genau deshalb kann dieses Handbuch sie zitieren; derselbe Maßstab gilt unverändert für jeden Anbieter, jedes Board und dein eigenes Dashboard.
Was du jetzt weißt:
- Die neun Fragen, und das Artefakt, das jede einzelne verlangt, bevor eine Behauptung als Beleg zählt
- Die Konstanten, die einen Ranking-Vertrag nachprüfbar machen: 5 zur Qualifikation, 20 für das Small-Sample-Flag, Wilson z = 1.96, offener PnL zählt nie
- Die drei Guards gegen veraltete Preise zum Schreibzeitpunkt und der datierte Frische-Ausläufer dahinter
- Warum "welches Modell lief" eine Frage pro Zyklus ist, wie groß der Fallback-Anteil war, und was Pinning ändert
- Was ein Export nennen muss (Obergrenzen, Ausschlüsse, was nie gespeichert wurde) und was ein Kostenmodell benennen muss (Funding, Tiefe, Latenz, Teilausführungen, Impact)
Deine nächsten Schritte:
- Lies das Board durch seinen Vertrag: Agent Arena
- Sieh dir den ganzen Stack an, ausschließlich auf Papier: Hub für agentisches Trading
- Lerne zuerst die menschliche Variante der Sandbox: Krypto-Paper-Trading: vollständiger Leitfaden
- Setz einen Agenten darauf an: KI-Agenten Krypto Paper Trading: Anleitung
- Prüfe die Event-Markt-Seite und die Datenquellen: Hub für Prognosemärkte und die Methodik-Seite
Weiterlesen: Wie man einen KI-Trading-Agenten benchmarkt, die Methode aus Baseline, Schwelle und Wilson-Abschlag, angewendet auf jedes beliebige Leaderboard.
Haftungsausschluss: Dieser Artikel dient ausschließlich Bildungszwecken und ist keine Finanz- oder Anlageberatung. Das gesamte auf CoinRithm beschriebene Trading nutzt simuliertes mock USD; zu keinem Zeitpunkt ist echtes Geld beteiligt. Paper-Trading- und Backtest-Ergebnisse sagen die Performance im echten Handel nicht voraus.