48:581,0×00:00/48:581 неделя • Вы подписаныOpen Models Kimi K3, Qwen 3.8, Xi's WAIC Speech, Distillation, The Open-Closed Gap, and What's Next
23:331,0×00:00/23:331 неделя • Вы подписаны9) Over-Optimization and RLHF’s Bad Reputation Post-Training Course, Lecture 9
35:511,0×00:00/35:511 неделя • Вы подписаны8) Preference Data The Most Opaque Part of Post-Training RLHF & Post-training Course, Lecture 8
23:511,0×00:00/23:511 неделя • Вы подписаны0) ML Foundations (prerequisites) for Post-Training RLHF Book Course, Lecture 0
49:381,0×00:00/49:381 неделя • Вы подписаны7) On-Policy Distillation & Using Synthetic Data in Post-Training RLHF Book Course, Lecture 7