
Chiffres illustratifs basés sur des runs enregistrés et des prix catalogue
L'argumentaire s'écrit tout seul : mettez un modèle de langage dans la boucle, laissez-le lire le carnet et les nouvelles, laissez-le décider. Avant de le construire, mettez deux chiffres côte à côte. Ce que coûte une décision, et ce que le marché paiera pour une décision juste.
Ce que vaut une décision
Sur les marchés crypto de 5 minutes, le carnet d'ordres est mince là où vit l'avantage. En milieu de fenêtre, le meilleur ask sur les plus gros coins représentait environ $140 à $165 de stock ; sur les plus petits, $3 à $47. Les cinq meilleurs niveaux réunis allaient de $55 à environ $1 465. Le favori de fin de fenêtre, le seul avantage taker qui a tenu, se déclenche sur environ 19 fenêtres exploitables par jour sur sept coins, et le ticket médian qui pouvait être exécuté au prix où l'avantage a été mesuré est de $10 à $12.
Prenez un ticket de $10 et un avantage de 2 points après frais. Une décision juste vaut environ 20 cents. Dix-neuf par jour, c'est moins de $4. C'est tout le prix que le marché offre à un taker de cette taille, avant la latence et avant l'érosion de l'avantage.
Ce que coûte une décision
Un modèle qui lit le carnet, le flux spot et quelques règles a besoin d'environ 1 500 tokens en entrée et 100 tokens en sortie par appel. Aux prix catalogue, cela fait environ un cinquième de cent sur le plus petit modèle actuel, quatre dixièmes de cent sur le niveau intermédiaire, et un cent sur le plus grand. Bon marché, jusqu'à ce que vous comptiez les appels.
| Modèle | Par décision | Chaque fenêtre, 7 coins (2 016 par jour) | Fenêtres exploitables seulement (19 par jour) |
|---|---|---|---|
| Petit (Haiku 4.5) | $0.002 | $4.03 par jour | $0.04 par jour |
| Intermédiaire (Sonnet 5) | $0.004 | $8.06 par jour | $0.08 par jour |
| Grand (Opus 5) | $0.010 | $20.16 par jour | $0.19 par jour |
Si le modèle regarde chaque fenêtre, même le plus petit dépense plus que ce que l'avantage rapporte. S'il ne regarde que les fenêtres qu'une règle fixe a déjà signalées comme exploitables, la facture d'API se compte en centimes. Mais alors c'est la règle qui a pris la décision, et le modèle est une façon très chère de dire oui.
La partie que la grille de prix cache
L'avantage de fin de fenêtre exige que l'ordre soit confirmé dans les 500 millisecondes environ qui suivent la lecture. Un appel de modèle prend une à plusieurs secondes. Le carnet réagit au flux spot en environ 16 millisecondes. Quoi que le modèle décide, il le décide après que le prix a bougé, et à deux secondes de retard la même règle perd quatre points au lieu d'en gagner deux. Le coût qui tue l'idée, c'est le temps, pas les tokens.
Sait-il quelque chose que le carnet ignore ?
La question sous-jacente à tout cela a été testée directement. Sur la crypto, la météo et le sport, le prix propre de l'exchange a prévu son propre règlement mieux que n'importe quel modèle construit contre lui, y compris un modèle nourri des sorties de modèle du National Weather Service et un autre nourri du flux de probabilité de victoire d'une ligue. Un modèle de langage qui lit le même carnet, le même prix spot et les mêmes nouvelles n'a pas non plus de nouvelle entrée. Il a une opinion. Le carnet a déjà celle de tout le monde.
Ce qui a fonctionné
Un petit arbre à gradient boosté sur neuf variables lues dans le carnet et le flux spot. Il tourne en moins d'une milliseconde, ne coûte rien par appel, a été entraîné sur une saison et testé une fois sur la suivante, et a rapporté environ 8 points par dollar pendant une semaine quand il était déclenché depuis un serveur dans la région de l'exchange. Il ne lisait pas les nouvelles. Il n'en avait pas besoin.
Où un modèle de langage gagne sa place
- Écrire le logger, la récupération des résultats et le code de recherche. Des semaines de travail en quelques jours.
- Lire chaque semaine la documentation et les conditions d'un exchange et signaler ce qui a changé ; une règle de règlement a changé du jour au lendemain pendant les tests et chaque bot qui modélisait l'ancienne règle était faux dès ce matin-là.
- Relire un backtest à la recherche des pièges qui fabriquent de faux avantages : labels dérivés, carnets figés, échantillonnage sur grille, recherche sans hypothèse nulle.
- Rédiger le seuil d'arrêt et le point de contrôle avant le lancement, pour qu'ils soient écrits pendant que vous êtes calme.
Ce sont des tâches à l'heure, pas à la fenêtre. La facture d'un mois de cela est plus petite qu'une journée à décider à chaque fenêtre, et le résultat est un meilleur bot plutôt qu'un bot plus lent.