
Números ilustrativos baseados em execuções registradas e preços de tabela
O discurso se escreve sozinho: coloque um modelo de linguagem no loop, deixe-o ler o livro e as notícias, deixe-o decidir. Antes de construir isso, ponha dois números lado a lado. Quanto uma decisão custa, e quanto o mercado paga por uma decisão certa.
Quanto vale uma decisão
Nos mercados de cripto de 5 minutos, o livro de ofertas é raso onde a vantagem mora. No meio da janela, o melhor ask nas maiores moedas tinha cerca de $140 a $165 de estoque; nas menores, de $3 a $47. Os cinco melhores níveis juntos iam de $55 a cerca de $1,465. O favorito de fim de janela, a única vantagem de taker que se sustentou, dispara em aproximadamente 19 janelas operáveis por dia em sete moedas, e o ticket mediano que podia ser executado ao preço em que a vantagem foi medida é de $10 a $12.
Pegue um ticket de $10 e uma vantagem de 2 pontos após taxas. Uma decisão correta vale cerca de 20 centavos. Dezenove delas por dia é menos de $4. Esse é o prêmio inteiro que o mercado oferece a um taker nesse tamanho, antes da latência e antes de a vantagem decair.
Quanto custa uma decisão
Um modelo que lê o livro, o feed spot e algumas regras precisa de cerca de 1.500 tokens de entrada e 100 de saída por chamada. A preços de tabela isso é cerca de um quinto de centavo no menor modelo atual, quatro décimos de centavo no nível médio e um centavo no maior. Barato, até você contar as chamadas.
| Modelo | Por decisão | Toda janela, 7 moedas (2,016 por dia) | Só janelas operáveis (19 por dia) |
|---|---|---|---|
| Pequeno (Haiku 4.5) | $0.002 | $4.03 por dia | $0.04 por dia |
| Médio (Sonnet 5) | $0.004 | $8.06 por dia | $0.08 por dia |
| Grande (Opus 5) | $0.010 | $20.16 por dia | $0.19 por dia |
Se o modelo olha toda janela, até o menor deles gasta mais do que a vantagem rende. Se ele só olha as janelas que uma regra fixa já marcou como operáveis, a conta da API é de centavos. Mas aí foi a regra que tomou a decisão, e o modelo é um jeito muito caro de dizer sim.
A parte que a tabela de preços esconde
A vantagem tardia precisa da ordem confirmada em cerca de 500 milissegundos após a leitura. Uma chamada de modelo leva de um a vários segundos. O livro reage ao feed spot em cerca de 16 milissegundos. O que quer que o modelo decida, ele decide depois que o preço se moveu, e a dois segundos de atraso a mesma regra perde quatro pontos em vez de ganhar dois. O custo que mata a ideia é o tempo, não os tokens.
Ele sabe algo que o livro não sabe?
A pergunta por trás de tudo isso foi testada diretamente. Em cripto, em clima e em esportes, o próprio preço da exchange previu a própria liquidação melhor do que qualquer modelo construído contra ele, incluindo um alimentado com a saída do modelo do National Weather Service e um alimentado com o feed de probabilidade de vitória da própria liga. Um modelo de linguagem lendo o mesmo livro, o mesmo preço spot e as mesmas notícias também não tem nenhuma entrada nova. Ele tem uma opinião. O livro já tem a de todo mundo.
O que funcionou
Uma pequena árvore com gradient boosting sobre nove features lidas do livro e do feed spot. Roda em menos de um milissegundo, não custa nada por chamada, foi treinada em uma temporada e testada uma vez na seguinte, e retornou cerca de 8 pontos por dólar durante uma semana quando disparada de um servidor na região da exchange. Ela não leu as notícias. Não precisou.
Onde um modelo de linguagem se paga
- Escrevendo o logger, o preenchimento de histórico e o código de pesquisa. Semanas de trabalho em dias.
- Lendo a documentação e os termos de uma exchange toda semana e sinalizando o que mudou; uma regra de liquidação mudou da noite para o dia durante os testes e todo bot que modelava a regra antiga estava errado a partir daquela manhã.
- Revisando um backtest em busca das armadilhas que fabricam vantagens falsas: rótulos derivados, livros congelados, amostragem em grade, busca sem hipótese nula.
- Redigindo a barra de parada e o checkpoint antes do lançamento, para que sejam escritos enquanto você está calmo.
Esses são trabalhos por hora, não por janela. A conta de um mês disso é menor do que um dia decidindo toda janela, e o resultado é um bot melhor em vez de um mais lento.