10,2 тыс подписчиков

Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

Chat-UniVi - унифицированная зрительно-языковая модель, способная понимать и участвовать в разговоре с использованием изображений и видео с помощью визуального представления.

В модели используется набор динамических визуальных маркеров для единообразного представления изображений и видео. Такая схема представления позволяет модели эффективно использовать ограниченное количество визуальных лексем для одновременного отражения пространственных деталей.

Обширные экспиременты показывают, что Chat-UniVi как единая модель стабильно превосходит даже существующие методы, предназначенные исключительно для работы с изображениями или видео.

🐱 Github: https://github.com/pku-yuangroup/chat-univi

📕 Paper: https://arxiv.org/abs/2311.08046v1

⏩ Dataset: https://paperswithcode.com/dataset/activitynet-qa

@machinelearning

Около минуты

16 ноября 2023