1 неделю назад
Spatially Speculative Decoding ускоряет авторегрессионные image-модели до 13
3×. Идея простая: перестать делать вид, что картинка - это просто длинная строка токенов. Обычно AR image-модель разворачивает 2D-изображение в последовательность и генерирует её токен за токеном. Это работает, но убивает скорость: каждый следующий шаг ждёт предыдущий. SSD добавляет маленькие draft-heads, которые используют пространственную структуру изображения. Они предсказывают не только следующий токен, но и соседние токены справа и снизу. По сути, модель начинает черновиком собирать сразу куски изображения и целые строки, а не идти по одному токену...