Как работает РАДИОСВЯЗЬ. Понятное объяснение!
Qwen3-1.7B прокачали с 48% до 58% на AIME 2024 RL-сигналом от слабой модели
Обучение с подкреплением по проверяемым наградам (RLVR, reinforcement learning with verifiable rewards), один из главных инструментов, которым лаборатории прокачивают способность языковых моделей рассуждать. Проблема в цене: чтобы дообучить таким способом каждую новую сильную модель, эта модель сама должна во время тренировки сгенерировать множество черновых прогонов (rollout), полных попыток решения задачи, и чем крупнее модель, тем дороже каждый такой прогон. По мере роста моделей это превращает пост-тренировку (донастройку после базового обучения) в узкое место...