Обучение с подкреплением в трейдинге: честная оценка
RL — самый запрашиваемый и реже всего доводимый до конца подход в частном квантовом трейдинге. Затык не в алгоритме, а в том, что нужный ему симулятор построить нельзя.
Инженеры Vizanix · об авторе
- РАЗДЕЛ
- Будущее рынка и ИИ
- ОПУБЛИКОВАНО
- 2026-08-29
- ГЛАВ
- 6
- ЧИТАТЬ ДАЛЬШЕ
- 3
- ЯЗЫК
- написано на русском
Обучение с подкреплением по форме действительно подходит трейдингу. Агент совершает действия в среде, получает отложенные награды и должен балансировать исследование и эксплуатацию. Рамка верна, поэтому идея и возвращается.
Проблемы не концептуальные. Это четыре практических препятствия, которые большинство попыток не переживает.
1. RL учит симулятор, а не рынок
RL нужно пробовать действия и наблюдать последствия миллионы раз. Вживую так нельзя, поэтому обучаются против симулятора — и агент с выдающейся эффективностью использует каждый его изъян.
Если ваш симулятор исполняет лимитку всякий раз, когда цена коснулась уровня, агент научится ставить лимитки на неправдоподобных уровнях. Если он игнорирует позицию в очереди, агент научится быть маркет-мейкером с идеальной наливаемостью. Полученная политика оптимальна против вашего кода и бессмысленна против площадки.
2. Влияние на рынок — то, что нельзя симулировать
В прогоне исторических данных ваши ордера не влияют на цену. В реальности влияют: вы съедаете глубину, обозначаете намерение, другие участники реагируют. Агент, обученный без влияния, выучивает стратегии, предполагающие бесконечную ликвидность по отображаемой цене.
Хорошо смоделировать влияние — самостоятельная исследовательская задача, а сделать это плохо хуже, чем не делать: вы получаете уверенность в числах, построенных на догадке.
3. Дизайн награды и есть то место, где решается стратегия
Наивная награда — это P&L, и она даёт агента, берущего огромный риск ради маржинальной доходности: неограниченное плечо максимизирует ожидаемый P&L в симуляторе, где нет разорения.
Награды с поправкой на риск помогают и вносят свои искажения: коэффициент Шарпа за эпизод поощряет минимизировать активность, штраф за просадку поощряет держать убыточные позиции вместо их закрытия. Любая функция награды — это спецификация стратегии, и написать её труднее, чем ту стратегию, писать которую вы пытались избежать.
4. Требовательность к данным против доступной истории
Современный RL известен своей прожорливостью к выборке — впечатляющие результаты приходят из сред, где можно генерировать неограниченные эпизоды. Финансовая история фиксирована и коротка, и каждый режим встречается считаное число раз.
Обучение на синтетике помогает с объёмом и вредит точности: агент выучивает допущения генератора. Многократное обучение на прогоне переобучает под конкретный путь, который прошла история.
Где RL всё-таки уместен: исполнение
Есть одна торговая задача, где RL действительно подходит, и это не та, о которой спрашивают. Оптимальное исполнение — дано решение купить X за следующие N минут, как это нарезать — обладает нужными RL свойствами:
- Пространство действий мало и хорошо определено: насколько быть агрессивным прямо сейчас.
- Обратная связь быстрая и измеримая: недобор относительно цены прибытия.
- Симулятор посильнее, потому что вы моделируете собственное влияние на коротком горизонте, а не предсказываете рынок.
- Доступна контрфактика: можно сравниться с TWAP и другими базовыми линиями.
Это негламурно, и здесь лежит ценность. Улучшения исполнения накапливаются на каждой сделке стратегии и, в отличие от сигнала, не распадаются, когда их находит кто-то ещё.
Если всё-таки хотите попробовать
- Сначала постройте симулятор и провалидируйте его отдельно: прогоните исторические исполнения и проверьте, что симулятор их воспроизводит.
- Включите влияние на рынок, пусть грубо. Неверная модель влияния лучше её отсутствия.
- Начните с исполнения, а не с направления.
- Валидируйте выученную политику так же, как любую модель: purged, вне выборки, с издержками внутри.
- Сравнивайте с простой базовой линией. Если побеждает TWAP — это и есть ответ.
Наша позиция: мы сделаем это, если заказчик хочет, и сразу скажем, что бустинг на хороших признаках плюс крепкий слой исполнения обычно доходит до продакшна раньше и работает сопоставимо. RL-проект — это исследовательский бюджет, а не план сдачи.
Статья описывает инженерную практику. Это не инвестиционная рекомендация. Vizanix разрабатывает программное обеспечение и не обещает торговую доходность.