Найти в Дзене
Покупайте СтеллыИ дарите их за контент
4 месяца назад
 • Вы подписаны

OpenClaw - эволюция Тамагочи или персональный Джарвис?

В зарубежном интернете (уже не оксюморон, хе-хе) пару месяцев хайпит персональный ИИ-ассистент - OpenClaw. Фишка этого агента в том, что он может автономно выполнять работу какого-нибудь офисного клерка или программиста. Кто не хотел бы такого персонального раба, который будет за вас выполнять всю рутинную и интеллектуальную работу? Я, естественно, захотел. Ниже расскажу, что у меня получилось, небольшой гайд по установке, подводные камни, некоторые лайфхаки и мое впечатление. OpenClaw - искусственный интеллект, который действительно что-то делает...

1 год назад
 • Вы подписаны

Спекулятивное декодирование в LM-Studio

В последнюю версию LM-Studio добавили новую функцию - спекулятивное декодирование. Мы джва года ее ждали. Ниже я расскажу, что это такое и как его использовать. Speculative decoding или, по-русски, спекулятивное декодирование - это метод ускорения генерации токенов большими языковыми моделями (LLM) за счет использования дополнительной модели меньшего размера. Спекулятивноедекодирования работает следующим образом. У вас есть две LLM с одинаковым словарем токенов, то есть нельзя использовать модели различных семейств, типа, llama и qwen, а вот llama-3...

1 год назад
 • Вы подписаны

Глубинно-рекуррентная языковая модель. Исследователи представили новую архитектуру LLM с рассуждениями в скрытом пространстве.

Это сенсация! То, что переведет привычные нам языковые модели на новый уровень. Опубликована научная статья и представлены веса глубинной рекуррентной модели со скрытыми рассуждениями. Суть в том (насколько я понял), что если обычная модель состоит из слоев (многослойный перцептрон), обычно их около 40 (в статье модель с 8 слоями), для получения каждого токена все эти 40 слоев просчитываются и на выходе получаем наиболее вероятный токен, то тут добавляется еще один слой (рекуррентный блок), причем добавляется сколько угодно раз для каждого вычисления...

1 год назад
 • Вы подписаны

мем

1 год назад
 • Вы подписаны

На фоне посредственных анонсов OpenAI мы пропускаем революцию. Выпущена первая языковая модель, которая прогнозирует не токены, а байты. EvaByte — это языковая модель на уровне байтов размером 6,5B, построенная на улучшенной архитектуре с многобайтовым прогнозированием и EVA — эффективным механизмом внимания, разработанным для масштабируемости и производительности. Обученная на 1,5 трлн байтов текста на естественном языке, математических данных и кода, EvaByte конкурирует с лучшими языковыми моделями с открытым исходным кодом на основе токенизаторов, используя в 5 раз меньше обучающих данных, превосходя их в задачах кодирования и декодируя в 2 раза быстрее. Модель все еще обучается, но уже превосходит многих LLM старичков. huggingface.co/...sft github.com/...yte потестить онлайн можно здесь huggingface.co/...yte

Покупайте СтеллыИ дарите их за контент