Лаборатория торгового агента (Q(a) ← (1 − α)Q(a) + αr)

Q(a) — текущая ценность действия, α — обучаемость, r — reward шага; новая оценка это смесь прошлого знания и нового результата.

Параметры эксперимента

Idle

Результат

Нет данных

Последние запуски

ID Symbol Interval PNL Balance LR Epsilon Created
История еще не загружена