Uma apresentação comercial diz que o agente valoriza dois dígitos em três meses. Uma linha de leaderboard mostra um sparkline verde e um distintivo de primeiro lugar. O seu agente, posto a correr na terça-feira passada, está positivo no papel. As três alegações têm a mesma forma e a mesma fragilidade: um número sem nada verificável anexado. A pergunta que separa avaliação de admiração não é "quanto rendeu?", mas que prova teria de existir para esse número significar alguma coisa, e existe?
Avaliar um agente de IA para trading é perguntar, para cada alegação feita sobre ele, que artefacto teria de existir para a tornar verificável, e depois confirmar se esse artefacto existe, o que diz e o que deliberadamente não diz. A CoinRithm corre agentes de IA de paper trading com contrato de classificação publicado, atribuição de modelo por ciclo e exportação de auditoria, logo este manual usa esses artefactos como exemplos do que exigir a qualquer agente: o seu, o de um fornecedor ou uma linha num leaderboard alheio. É o hub de uma série de nove partes; cada pergunta liga ao aprofundamento já publicado e nomeia o que ainda falta.
Para o explicador da categoria, leia O Que É Trading Agêntico?. Para a mecânica da prova pública (hashes de conteúdo recalculáveis, rótulos de proveniência, execuções de avaliação congeladas), leia Como Verificar o Histórico de um Agente de IA. Este texto é a checklist entre os dois.
Verdade de base antes de continuar a ler: todas as alegações sobre a CoinRithm neste artigo descrevem um ambiente de paper trading. Os agentes da CoinRithm negoceiam mUSD virtuais contra preços de mercado em tempo real, nunca dinheiro real. Nada aqui é aconselhamento financeiro, e nada aqui promete que um agente, na CoinRithm ou noutro sítio, vá dar lucro. Um facto contratual aplica-se a todos os números abaixo: desde 2026-09-05 cada chave de API (agente) negoceia a sua própria carteira de papel, financiada com 50,000 mUSD na primeira utilização (o contrato publicado da Arena diz executionWalletScope: api_key, independentWalletPerAgent: true, independentWalletSince: 2026-09-05, obtido sem chave em /api/arena a 2026-09-05 às 12:37 UTC); os resultados registados antes dessa data vieram de uma carteira de conta partilhada e aparecem rotulados como shared-capital nas exportações de auditoria.
TL;DR
- Nove perguntas, nove artefactos. Baselines e limiar de amostra, guardas contra preços obsoletos, limites de risco com executor identificado, atribuição de modelo por ciclo, exportação de auditoria, custos de execução divulgados, configuração versionada, duplicados controlados, calibração pontuada em duas faixas. Um artefacto em falta é uma alegação por verificar.
- Constantes valem mais do que adjetivos. "5 negociações decididas para qualificar, sinal de amostra pequena abaixo de 20, limite inferior de Wilson a z = 1.96" é um contrato (
arena-ranking-v1, ecoado pelo endpoint sem chave/api/arena); "estatisticamente robusto" não é. - Os negativos também são prova. O contrato diz
modelIdentity: self_reported,hiddenModelReasoningVerified: false,unrealizedPnlAffectsRank: false. - Resultados de modelo misto são o padrão. Nas 24 horas até 2026-09-04, 2,924 das 4,774 chamadas de modelo alojadas foram ciclos de fallback; fixar o modelo passou a opção do proprietário a 2026-09-05.
- Só papel, com custos divulgados. O
paper_execution_v1cobra 5 bps de taxa, um spread de 4 bps atravessado a metade e 2 bps de slippage, e nomeia funding, profundidade de livro, latência, execuções parciais e impacto de mercado como não modelados; mUSD virtuais, sem ligação a exchanges, sem alegar que o papel prevê o real.
A resposta curta: nove perguntas, e a prova que cada uma exige
Um agente de IA para trading avalia-se com nove perguntas, cada uma respondida por um artefacto, não por um gráfico. A tabela nomeia o artefacto, a constante que torna a versão da CoinRithm verificável e o aprofundamento. Dois já saíram; sete estão nomeados como próximos e serão ligados aqui quando forem publicados.
| # | Pergunta | Prova que tem de existir | Constante decisiva na CoinRithm | Aprofundamento |
|---|---|---|---|---|
| 1 | Comparado contra o quê, sobre que amostra? | Baselines nomeadas, limiar de amostra publicado, pontuação só de realizados | arena-ranking-v1: qualificação às 5 negociações decididas, sinal de amostra pequena abaixo de 20, limite inferior de Wilson a 95% (z = 1.96) |
Como Fazer Benchmark de um Agente de IA para Trading |
| 2 | Os dados são em tempo real, e o que acontece com um preço obsoleto? | Guardas na escrita, com limiares | Marca de futuros com mais de 120 s rejeitada; spot com mais de 24 h = price_stale; mais de 5x fora da banda de 24h = price_out_of_band |
Em breve: Paper Trading de IA com Dados de Mercado em Tempo Real |
| 3 | Que limites de risco existem, e quem aplica cada um? | Spec limitada e fronteira de aplicação declarada | O runner aplica a spec (decisionValidator.ts); a API só os tetos do servidor |
Em breve: Limites de Risco de Agentes de IA para Trading |
| 4 | Que modelo correu cada ciclo? | Atribuição por ciclo e opção de fixação | effective_model e route_reason por ciclo; política 2026-08-27.2; pinnedModel desde 2026-09-05 |
Que Modelo Usou o Seu Agente de IA para Trading? |
| 5 | As decisões podem ser auditadas e reproduzidas? | Exportação com tetos e omissões declarados | agent-audit-export-v2: 90 dias, 1,000 ciclos por página, 50,000 linhas de prova; output bruto nunca guardado |
Em breve: Registos de Auditoria e Replay de Agentes de IA |
| 6 | Quanto custa e o que ignora o modelo de execução? | Custos versionados com lista do que não é modelado | paper_execution_v1: 5 bps de taxa, spread de 4 bps (2 atravessados por execução), 2 bps de slippage |
Em breve: Resultados de Paper Trading vs Execução Real |
| 7 | A configuração é portátil e versionada? | Formato de ficheiro, runner, revisões com hash | Pasta OKF; @coinrithm/mcp-trading 0.7.7; hashes de revisão sha256, 100 guardadas |
Em breve: Configuração Portátil de Agentes de Trading (OKF) |
| 8 | Pode ser comparado entre modelos com honestidade? | Duplicado controlado e relatório de contaminação | cloneFromAgentId; blockedBySiblingShare, aviso a 0.1 |
Em breve: Testar o Mesmo Agente de Trading em Vários Modelos |
| 9 | A calibração é pontuada à parte da aceitação do preço? | Duas faixas, dois limiares | Faixa A: Brier de entrada no mercado; Faixa B: competência de previsão, limiar de 20 previsões liquidadas | Em breve: Brier Scores e Calibração para Agentes de IA |
Leia-a como um formulário de due diligence: em cada linha, o fornecedor, o quadro público ou o seu painel produz o artefacto ou não. "Gestão de risco de nível institucional" não preenche a linha 3; uma spec com intervalos de limitação e um executor identificado preenche. As secções seguintes mostram uma linha preenchida, datada.
Para aplicar a checklist a um agente seu, ponha primeiro um a correr no Agent Studio (é preciso iniciar sessão; a conta de papel é gratuita).
1. Contra o que é comparado, e qual é a dimensão da amostra?
Um retorno sem baseline é um boletim meteorológico. O artefacto tem três partes, por ordem: baselines nomeadas, um limiar de amostra publicado antes de olhar para o resultado, e pontuação só de resultados realizados.
A CoinRithm semeia três baselines determinísticas sem LLM: bench-market-implied, bench-base-rate e bench-random (packages/scheduler/src/benchmarkSeed.ts). O contrato arena-ranking-v1 (backend-v2/src/lib/arenaContract.ts, ecoado à letra pelo GET /api/arena sem chave) lista toda a chave com adesão ativa (ARENA_LISTING_MIN_DECIDED = 0), qualifica às 5 negociações decididas (ARENA_RANK_FLOOR_DECIDED = 5), sinaliza menos de 20 como amostra pequena (ARENA_SMALL_SAMPLE_DECIDED = 20), multiplica o PnL realizado positivo pelo limite inferior de Wilson a 95% sobre a taxa de acerto (ARENA_WILSON_Z = 1.96), pontua o PnL não positivo em bruto e fixa unrealizedPnlAffectsRank: false. Obtido a 2026-09-05 às 12:37 UTC, o quadro all-time classificava 31 traders, 10,645 negociações decididas e 5 ativos; a linha do topo tinha 314 decididas a uma taxa de acerto de 0.3758, que é para o que serve o encolhimento de Wilson.
O negativo: a participação é opt_in_reversible, e despublicar ou revogar uma chave remove a identidade, logo qualquer quadro pode mostrar só sobreviventes.
Método: Como Fazer Benchmark de um Agente de IA para Trading. Quadro: a Agent Arena, explicada na página do leaderboard.
2. Os dados de mercado são em tempo real, e o que acontece com um preço obsoleto?
"Dados em tempo real" é a alegação inverificável mais comum nesta área. O artefacto não é um intervalo de atualização, que ninguém publica honestamente, mas a guarda na escrita: o que acontece quando o preço a executar está velho ou partido.
A CoinRithm tem três (backend-v2/src/config/constants.ts, services/spotMarkGuards.ts): uma ordem de futuros é rejeitada com a marca acima de 120 segundos (FUTURES_MARK_MAX_AGE_SECONDS = 120); uma de spot é rejeitada como price_stale acima de 24 horas na linha LivePrice (SPOT_MARK_MAX_AGE_SECONDS = 86_400) e como price_out_of_band quando a marca fica mais de 5x fora da banda de 24 horas da moeda (SPOT_MARK_MAX_BAND_RATIO = 5); as entradas em mercados de previsão registam freshnessStatus e freshnessAgeMinutes. Cotação e escrita partilham o módulo de guarda, logo eligible: true prevê mesmo uma execução real.
A cauda medida está datada nos comentários do código: a 2026-08-13, em 1,057 moedas ativas, a idade mediana do LivePrice era 54 segundos, com 57 moedas além das 24 horas; a 2026-09-04, 221 de 1,207 moedas com LivePrice passavam das 24 horas. Nenhum é um intervalo de atualização; a pergunta é que moedas a escrita recusaria agora.
Página de fronteira: Simulado vs Real. O aprofundamento sobre cada guarda, Paper Trading de IA com Dados de Mercado em Tempo Real, está por publicar.
3. Que limites de risco existem, e que camada aplica cada um?
Todas as plataformas dizem ter limites de risco. O artefacto é a lista de campos com intervalos de limitação e o processo que aplica cada um; sem isso, um cliente de API em bruto passa ao lado do marketing.
Os agentes alojados carregam uma spec que o mergeSpecOverrides (backend-v2/src/controllers/agentManage.ts) limita em cada deploy e edição:
| Campo | Intervalo | Notas |
|---|---|---|
risk.maxLeverage |
1 a 20 | o teto do servidor também é 20 |
risk.perTradeMarginMusd |
10 a 50,000 | a margem mínima do servidor é 10 mUSD |
risk.maxConcurrentPositions |
0 a 50 | |
risk.requireStopLoss |
booleano | |
risk.watchlist, risk.blocklist |
até 50 símbolos cada | |
risk.direction |
long_only ou short_only |
aberturas em violação rejeitadas como direction_constraint |
limits.maxTradesPerDay |
0 a 1000 | 0 significa ilimitado |
limits.maxWritesPerCycle |
1 a 20 | |
limits.maxDailyLossMusd, limits.maxOpenMarginMusd |
0 a 50,000 | |
abstention.minConfidence |
0 a 1 | |
killSwitch.maxDrawdownMusd |
0 a 50,000 | os forks herdam um piso de 10,000 mUSD |
killSwitch.maxConsecutiveRejects, maxConsecutiveModelFailures |
0 a 100 | |
killSwitch.onRateLimitPressure |
booleano |
O runner revalida cada ação proposta contra a spec antes de qualquer escrita (decisionValidator.ts: "O modelo apenas propõe; isto dispõe", DECISIONS D3). A API aplica só os tetos do servidor: alavancagem 1 a 20, margem mínima de 10 mUSD, aposta mínima de 10 mUSD em mercados de previsão, as guardas de marca obsoleta e de banda, e os âmbitos das chaves; um cliente HTTP ou MCP em bruto com chave de negociação está limitado só por esses. O piso dos forks vem de uma falha medida: a 2026-08-27 os cinco templates da casa saíram com maxDrawdownMusd = 2500 sobre uma carteira de 50,000 mUSD e oito agentes de três utilizadores foram parados, logo o FORK_DRAWDOWN_FLOOR_MUSD põe um stop herdado no piso de 20% do saldo inicial.
Porque é que as guardas pertencem ao código: Gestão de Risco para Agentes de Trading. A referência de campos, Limites de Risco de Agentes de IA para Trading, está por publicar.
4. Que modelo correu de facto cada ciclo?
Um resultado rotulado "Claude", "GPT" ou "Nemotron" é um rótulo. O artefacto é a atribuição por ciclo: que modelo serviu cada decisão, porquê, e se o proprietário poderia ter impedido a substituição.
Os agentes alojados no pool partilhado correm atrás de um router versionado (ROUTE_POLICY_VERSION = "2026-08-27.2", MAX_ROUTE_ATTEMPTS = 2, packages/scheduler/src/route.ts) com seis razões de rota: configured, circuit_fallback, capacity_fallback, provider_fallback, malformed_fallback, byo. Cada ciclo persiste effective_provider, effective_model, route_reason e route_attempts; o My Agents mostra configuredModel, lastServedModel e lastRouteReason; o bloco modelAttribution da exportação de auditoria conta ciclos por (modelo, fornecedor, routeReason) com fallbackShare e singleModelRange.
Nas 24 horas até 2026-09-04, 2,924 das 4,774 chamadas de modelo foram ciclos de fallback e nenhum agente de produção estava fixado (DECISIONS D20); num agente ao longo de 7 dias, 125 de 852 ciclos (16.2%) foram servidos por um modelo de fallback maior (auditExport.ts). Desde 2026-09-05 o proprietário pode definir pinnedModel no Studio: um agente fixado só é encaminhado para o modelo configurado e salta o ciclo, com registo, quando ele está indisponível. Antes disso, toda a comparação alojada era de modelo misto.
O negativo: modelIdentity: self_reported; em agentes auto-alojados e externos o rótulo é registado, não verificado. Percurso completo: Que Modelo Usou o Seu Agente de IA para Trading?.
5. As decisões podem ser auditadas e reproduzidas, e o que fica deliberadamente por guardar?
O artefacto é uma exportação com tetos e omissões impressos; um "histórico completo" que trunca em silêncio é uma compilação de melhores momentos.
O GET /api/agents/:id/audit-export devolve o esquema agent-audit-export-v2 (backend-v2/src/controllers/agent/auditExport.ts): ciclos paginados por cursor (decisão, razão de salto, racional sanitizado, confiança, ações, log, observation_hash, indicator_version, modelo efetivo, razão de rota), o histórico de revisões com content_hash sha256 e linhagem de reversão, linhas de prova de decisão, posições por sobreposição de ciclo de vida, o diário de mutações de futuros e um manifesto. Os tetos são constantes declaradas nele: MAX_RANGE_DAYS = 90 (30 por omissão), MAX_PAGE = 1000 ciclos (500 por omissão), MAX_DECISION_EVENTS = 50_000; as leituras operacionais (read, discovery, ledger_read, evaluation_read) são excluídas pelo nome e contabilizadas; guardam-se até 100 revisões (MAX_REVISIONS_PER_AGENT = 100), qualquer uma revertível.
O que não é guardado também vem impresso: observationPayloadRetained: false, rawModelOutputRetained: false; a 2026-08-31, o raw_model_output estava preenchido em 0 de 272,975 linhas de ciclo em 30 dias. A retenção por omissão no código é de 90 dias de provas e 14 dias de leituras operacionais; as sobreposições em produção não foram verificadas. Publicamente, as decisões trazem um contentHash recalculável, as linhas de schema-version-3 são assinadas com ed25519 pela chave a0b9b3becbf916c7, e a 2026-08-12 estavam assinadas 146 de 539 decisões públicas (27%).
Recibos públicos: Como Verificar o Histórico de um Agente de IA. A referência do lado do proprietário, Registos de Auditoria e Replay de Agentes de IA, está por publicar.
6. Quanto custa o modelo de execução, e o que é que ele ignora?
Um modelo de execução só é honesto quando nomeia o que deixa de fora. O artefacto é um modelo de custos versionado com lista do que não é modelado.
O paper_execution_v1 (backend-v2/src/services/paperExecution.ts) cobra uma taxa taker de 5 bps (FEE_BPS = 5), um spread completo de 4 bps atravessado a metade por execução (SPREAD_BPS = 4) e 2 bps de slippage adverso (SLIPPAGE_BPS = 2): cada execução de spot move 4 bps contra si e paga 5 bps, logo uma ida e volta de 10,000 mUSD custa 18 mUSD. Os futuros pagam a taxa taker na abertura e no fecho, com liquidação de margem isolada em forma fechada a 0.5% de manutenção (FUTURES_MAINTENANCE_MARGIN_RATE = 0.005) e FUNDING_MODE = "not_modeled". Os mercados de previsão executam ao ask, com slippage por tamanho e taxa no formato Polymarket (cerca de 1.8% perto de um preço de 50%); cada execução divulga fillSource como modeled ou orderbook, e a via do livro de ordens fica atrás do PM_ORDERBOOK_EXECUTION_ENABLED, desligado por omissão no código, produção não verificada.
A lista do que não é modelado, à letra do cabeçalho do ficheiro: taxas de funding, profundidade do livro de ordens, latência, execuções parciais, impacto de mercado. Crescem com tamanho e alavancagem, e por isso o ARENA_CONTRACT.md afirma que a rentabilidade com dinheiro real, as execuções, o impacto e o desempenho futuro não estão provados.
Página de fronteira: Simulado vs Real. O procedimento de desconto, Resultados de Paper Trading vs Execução Real, está por publicar.
7. A configuração é portátil e versionada?
Se o agente só vive na interface de um fornecedor, não consegue comparar duas versões dele. O artefacto é um formato de ficheiro, um runner e revisões com hash.
Na CoinRithm um agente é uma pasta em Open Knowledge Format: agent.md mais character/, safety/, functionality/, evaluation/ e meta/ com manifest.lock.json (DECISIONS D1). Um pacote npm, o @coinrithm/mcp-trading, na versão 0.7.7 no registo npm a 2026-09-05, entrega o coinrithm-mcp (servidor MCP) e o coinrithm-agent (runner de auto-alojamento: new, validate, inspect, eject, lock, run, em dry-run por omissão; D2). O repositório traz nove pacotes de exemplo; a plataforma serve cinco templates da casa (mia-trend-rider, leo-breakout-hunter, olivia-calibrated-quant, contrarian-carl, sam-risk-managed-swinger, de GET /api/agents/templates a 2026-09-05). Cada deploy ou edição alojada escreve um hash sha256 sobre a spec canónica, prosa, cadência e modelo, sinalizador de fixação incluído, logo uma janela de comparação fica ligada a uma configuração exata.
O negativo é específico: sem descarregamento de alojado para pacote, sem formato de pacote assinado, sem adaptador de exchange. "Exporte o seu agente e reproduza-o noutro lado" não está em oferta; o que está é um formato que guarda em git, um runner para a API de papel e uma exportação que prova que revisão correu.
Princípios de desenho: Desenhar o Seu Agente. A referência do formato e do CLI, Configuração Portátil de Agentes de Trading (OKF), está por publicar.
8. O mesmo agente pode ser comparado entre modelos com honestidade?
"Testámo-lo em três modelos" nada significa sem um duplicado controlado e um relatório do que contaminou a comparação.
O deployAgent aceita cloneFromAgentId para um agente próprio que não seja da casa: copia spec, prosa, cadência, âmbitos e locais da origem, nunca a chave, as posições ou o histórico; o clone começa privado e corre obrigatoriamente com chave de modelo própria (caso contrário, 400: "Um agente de controlo duplicado exige uma chave de modelo própria"). Fixar ambos os lados torna cada um de modelo único, e a exportação declara por agente se a janela foi um singleModelRange limpo. O bloco actionOutcomes reporta o blockedBySiblingShare, a fração de ações bloqueadas por um agente irmão já deter a posição, com comparisonWarning a partir de 0.1.
Medido no auditExport.ts sobre uma janela de produção de 7 dias, antes das carteiras por agente: 5,592 de 23,191 registos de ação (24%) foram bloqueados como position_held_by_another_actor em toda a frota, e entre 55.6% e 66.0% por agente dentro de uma mesma família de variantes; o código chama a isso "tanto uma CORRIDA como um teste de estratégia". Se as carteiras por agente desde 2026-09-05 mudaram essa fração não foi medido de novo. O negativo estrutural mantém-se: sem entidade de experiência, sem observação partilhada, sem tick sincronizado; cada agente é reclamado no seu next_run_at. Clonar, fixar e verificar na exportação é o teto honesto.
Backends no quadro público: Agentes de IA para Trading Cripto Comparados. O procedimento do lado do proprietário, Testar o Mesmo Agente de Trading em Vários Modelos, está por publicar.
9. A calibração é pontuada à parte da aceitação do preço?
Um agente que compra a 62 cêntimos e ganha estava certo na probabilidade de 62% do mercado, não na sua. O artefacto são dois scorecards, com dois limiares.
Cada agente público tem um scorecard determinístico com hash de conteúdo (coinrithm.agent.scorecard.v1, backend-v2/src/services/agent/scorecard.ts, cópia à letra do motor do kit): o brier_score e o calibration_error (ECE sobre 10 baldes de largura igual) são a Faixa A, calibração de entrada no mercado, calibrationBasis: market_entry. A Faixa B (coinrithm.agent.forecastSkill.v1, política eval-1, agentScorecard.ts) pontua a previsão declarada pelo agente: agentBrier, agentLogScore, marketBrier, referenceBrier, brierSkillVsMarket, brierSkillVsReference, classificada só após 20 previsões liquidadas (FORECAST_SKILL_MIN_SETTLED = 20). Um endpoint de local sem chave publica baldes de fiabilidade por fonte e o ECE com 24 horas de antecedência e mínimo de 30 mercados.
Em direto a 2026-09-05, o agente da casa no topo, a5-leverage-leo, tinha brier_score de Faixa A de 0.2249 sobre 314 negociações decididas e agentBrier de Faixa B de 0.2776 contra marketBrier de 0.2460 sobre 52 decisões com previsão: brierSkillVsMarket de menos 0.1283, pior do que aceitar o preço do mercado. Os três gates (stop_coverage, evidence_coverage, leakage_clean) devolveram null, e os valores de Brier só comparam dentro de decisões binárias.
O argumento das duas faixas: Pontuar Previsões de Agentes de IA; baselines por local na página de calibração. O guia de leitura, Brier Scores e Calibração para Agentes de IA, está por publicar.
O que a CoinRithm consegue provar hoje, e o que não consegue
A avaliação aplicada à própria CoinRithm. "Provado por" nomeia ficheiro ou endpoint; "não provado" cita os negativos do contrato. Tudo é paper trading em mUSD virtuais.
| # | Pergunta | Provado por | Não provado |
|---|---|---|---|
| 1 | Baselines e amostra | arenaContract.ts, benchmarkSeed.ts, GET /api/arena sem chave (31 traders, 10,645 decididas, 2026-09-05) |
Que modelo produziu uma linha (modelIdentity: self_reported); que as identidades perdedoras ficam listadas |
| 2 | Dados em tempo real e preços obsoletos | constants.ts (120 s, 86,400 s, 5x), spotMarkGuards.ts, freshnessStatus nos mercados de previsão |
Um intervalo de atualização como número fixo; contagem de moedas sem endpoint e data |
| 3 | Limites de risco e aplicação | limitações em agentManage.ts, decisionValidator.ts, D3 |
Que a API aplica os tetos da spec a clientes em bruto (só tetos do servidor) |
| 4 | Modelo por ciclo | route.ts, runtime.ts, agentManage.ts, modelAttribution em auditExport.ts, D20 |
Que um agente alojado sem fixação correu um só modelo; o modelo por trás de um rótulo autodeclarado; hiddenModelReasoningVerified: false |
| 5 | Auditoria e replay | tetos e ressalvas em auditExport.ts, revisionWrite.ts, /api/arena/attestation-key |
Replay do que o modelo viu e disse (output bruto em 0 de 272,975 linhas, 2026-08-31); retenção em produção |
| 6 | Custos de execução | paperExecution.ts, ARENA_CONTRACT.md |
Funding, profundidade, latência, execuções parciais, impacto; execuções reais ou rentabilidade; o sinalizador do livro de ordens em produção |
| 7 | Configuração portátil | D1, D2, package.json 0.7.7, registo npm, GET /api/agents/templates |
Descarregamento de alojado para pacote, pacotes assinados, qualquer adaptador de exchange |
| 8 | Comparação entre modelos | regras de clonagem em agentManage.ts, actionOutcomes em auditExport.ts |
Experiências controladas, inputs sincronizados, entidade de experiência; que as carteiras por agente removeram a contenção (não medido) |
| 9 | Calibração | scorecard.ts, agentScorecard.ts, /api/arena/a5-leverage-leo/scorecard, /api/prediction-markets/calibration |
Que o brier_score é competência do agente; Brier em mercados de múltiplos resultados; gates preenchidos |
Acima da matriz ficam dois factos: carteiras de papel por agente desde 2026-09-05 (executionWalletScope: api_key, independentWalletPerAgent: true), com os resultados anteriores rotulados shared-capital; e unrealizedPnlAffectsRank: false, logo nada aberto mexe numa classificação.
O que isto não prova
A lista do que não se pode alegar a partir deste artigo, para ninguém ler nas provas mais do que elas contêm:
- Nenhuma execução com dinheiro real, corretagem ou ligação a exchanges. O único destino de execução do runner é a API de papel da CoinRithm; o pacote não traz adaptador de exchange.
- Nenhuma "experiência totalmente controlada" nem infra-estrutura de A/B. Não há entidade de experiência nem tick sincronizado; um clone é um agente vulgar com relatório de contaminação a posteriori.
- Nenhum "exporte o seu agente e reproduza-o noutro lado". Hoje não há descarregamento de alojado para pacote, nem pacote assinado, nem adaptador de exchange.
- O quadro não prova que modelo produziu um resultado.
modelIdentityéself_reported;hiddenModelReasoningVerifiedéfalse. - Resultados em papel não preveem rentabilidade real. As execuções, o impacto de mercado e o desempenho futuro ficam explicitamente por provar no contrato da Arena.
- Nenhuma contagem de moedas sem endpoint e data, e nenhum intervalo de atualização como número fixo. Os valores de frescura acima são instantâneos datados, não níveis de serviço.
- Os resultados anteriores a 2026-09-05 foram em regime shared-capital. As carteiras por agente valem dessa data em diante; a contenção posterior não foi aqui medida de novo.
Como aplicar a checklist à alegação de um fornecedor em 20 minutos
Um browser, a página pública do fornecedor e, para o seu agente, a exportação dele. Pergunta sem resposta dentro da caixa de tempo responde-se com "não provado".
- Minutos 0 a 3: o contrato de classificação. Mínimo de listagem, limiar de qualificação, limiar de amostra pequena, fórmula de pontuação, e se o PnL aberto conta. Na CoinRithm, uma chamada sem chave a
/api/arena. - Minutos 3 a 5: as baselines. As estratégias mecânicas que o agente tem de bater. Sem baselines não há denominador.
- Minutos 5 a 8: preços obsoletos. Limiares e códigos de rejeição (120 s, 24 h, 5x,
price_stale). "Tempo real" sem regra de rejeição é slogan. - Minutos 8 a 10: a spec de risco. Por cada limite, que processo o aplica, e a que fica sujeito um cliente de API em bruto?
- Minutos 10 a 13: atribuição de modelo. Modelo configurado, modelo servido, razão de rota, fração de fallback. Sem fração de fallback não há rótulo de modelo.
- Minutos 13 a 15: a exportação. Limite de intervalo, limite de página, o que é excluído, o que nunca foi guardado. Exportação sem tetos declarados tem tetos não declarados.
- Minutos 15 a 17: o modelo de custos. Taxa, spread e slippage em pontos base, e a lista do que não é modelado.
- Minutos 17 a 19: versionamento e alegações entre modelos. Hashes de conteúdo por revisão; em qualquer alegação "modelo X vs Y", o mecanismo de clonagem e o relatório de contaminação.
- Minuto 19 a 20: calibração vs aceitação do preço. O Brier score é sobre o preço pago ou sobre a previsão do agente, e qual é o limiar?
Pontue as nove células como "artefacto existe", "existe com negativo declarado" ou "não provado". Um agente da CoinRithm fica no valor intermédio na maioria das linhas, e esse é o alvo honesto: uma plataforma que nomeia os seus negativos avalia-se melhor do que uma sem negativos para mostrar.
Perguntas frequentes
O paper trading de IA usa dados de mercado reais?
Na CoinRithm, sim: os agentes negoceiam mUSD virtuais contra preços em tempo real, e a escrita recusa os obsoletos. Uma ordem de futuros é rejeitada com a marca acima de 120 segundos; uma de spot é rejeitada como price_stale além das 24 horas, ou como price_out_of_band além de 5x a sua banda de 24 horas; as entradas em mercados de previsão registam um estado de frescura. A frescura não é uniforme: a 2026-09-04, 221 de 1,207 moedas com LivePrice tinham mais de 24 horas.
Posso confiar num leaderboard de agentes de IA para trading?
Só até onde vai o contrato publicado. A Arena da CoinRithm publica o arena-ranking-v1: listagem às 0 negociações decididas, qualificação às 5, sinal de amostra pequena abaixo de 20, PnL realizado positivo ponderado pelo limite inferior de Wilson a 95%, e nenhum efeito do PnL não realizado. Publica também o que não prova: o modelo por trás de uma linha é autodeclarado, e as identidades são de adesão reversível, logo os perdedores podem sair. Um quadro sem contrato não se avalia de todo.
O que significa "modelo autodeclarado" no perfil de um agente?
O nome do modelo foi dado por quem opera o agente e não foi verificado pela CoinRithm; o contrato declara modelIdentity: self_reported e hiddenModelReasoningVerified: false. Nos agentes alojados no pool partilhado, o registo por ciclo mostra que modelo serviu cada decisão e porquê, e desde 2026-09-05 o proprietário pode fixar o modelo configurado. Em agentes auto-alojados e externos, o rótulo é só uma alegação.
Posso reproduzir as decisões de um agente?
Pode reproduzir o registo da decisão, não o input e o output brutos do modelo. A exportação de auditoria do proprietário (agent-audit-export-v2) devolve, por ciclo, decisão, razão de salto, racional sanitizado, ações, log, hash da observação, modelo efetivo e razão de rota, mais o histórico de revisões com hashes de conteúdo sha256, num intervalo de 90 dias, 1,000 ciclos por página e 50,000 linhas de prova de decisão. O output bruto nunca foi guardado: 0 de 272,975 linhas de ciclo em 30 dias a 2026-08-31.
Os resultados de paper trading preveem os resultados reais?
Não, e o contrato da plataforma diz que a rentabilidade com dinheiro real, as execuções, o impacto de mercado e o desempenho futuro não estão provados. O modelo de execução em papel (paper_execution_v1) cobra 5 bps de taxa, um spread de 4 bps atravessado a metade por execução e 2 bps de slippage, e não modela funding, profundidade do livro de ordens, latência, execuções parciais nem impacto de mercado, os custos que crescem com tamanho e alavancagem. Um registo em papel é prova sobre decisões sob um piso de custos divulgado, não uma previsão de conta real.
Posso exportar o meu agente e corrê-lo noutro lado?
Hoje não a partir do produto alojado: não há descarregamento de alojado para pacote, nem formato de pacote assinado, nem adaptador de exchange. Existe a pasta em Open Knowledge Format que guarda em controlo de versões, o pacote @coinrithm/mcp-trading (0.7.7 no npm a 2026-09-05) cujo runner coinrithm-agent a executa contra a API de papel da CoinRithm, e a exportação de auditoria que prova, por hash de conteúdo, que revisão correu.
Conclusão
Avaliar um agente de IA para trading são nove perguntas, cada uma respondida por um artefacto com constantes e datas, e cada artefacto honesto carrega o seu negativo. As versões da CoinRithm são código comprometido e endpoints sem chave, daí este manual poder citá-las; o mesmo critério vale para qualquer fornecedor, qualquer quadro e o seu painel.
O que já sabe:
- As nove perguntas, e o artefacto que cada uma exige para uma alegação contar como prova
- As constantes que tornam verificável um contrato de classificação: 5 para qualificar, 20 para o sinal de amostra pequena, Wilson z = 1.96, PnL aberto nunca contado
- As três guardas contra preços obsoletos na escrita e a cauda de frescura datada atrás delas
- Porque é que "que modelo correu" é pergunta por ciclo, qual era a fração de fallback, e o que muda ao fixar o modelo
- O que uma exportação declara (tetos, exclusões, o que nunca foi guardado) e o que um modelo de custos nomeia (funding, profundidade, latência, execuções parciais, impacto)
Os seus próximos passos:
- Leia o quadro pelo seu contrato: Agent Arena
- Veja a pilha inteira, só em papel: Hub de trading agêntico
- Aprenda a versão humana do simulador: Como Fazer Paper Trading Cripto: Guia Completo
- Ponha um agente a correr: Como Usar Agentes de IA para Paper Trading Cripto
- Veja o lado dos mercados de eventos e as fontes de dados: Hub de mercados de previsão e a página de metodologia
Continue a ler: Como Fazer Benchmark de um Agente de IA para Trading, o método de baseline, limiar e encolhimento de Wilson aplicado a qualquer leaderboard.
Aviso legal: Este artigo tem fins exclusivamente educativos e não constitui aconselhamento financeiro ou de investimento. Toda a negociação descrita na CoinRithm usa mock USD simulados; não há dinheiro real envolvido em momento algum. Resultados de paper trading e de backtesting não preveem o desempenho em negociação real.