AI Ревизор
2
подписчика
Проверяем громкие заявления разработчиков нейросетей на фактах. Разборы научных техотчетов, реальные бенчмарки, тесты производительности и открытый софт без маркетинговой шелухи.
Проверяем громкие заявления разработчиков нейросетей на фактах. Разборы научных техотчетов, реальные бенчмарки, тесты производительности и открытый софт без маркетинговой шелухи.
4 дня назад
• Вы подписаны
Хардварный стресс-тест Флагманская модель Meta с открытыми весами Llama-3.3-70B по качеству логики и кода сравнялась с оригинальной Llama-3.1-405B, но требует в шесть раз меньше вычислительных ресурсов. На вторичном рынке две потребительские видеокарты RTX 3090 (24GB) стоят суммарно дешевле одной RTX 4090, а аппаратный мост NVLink объединяет их в единый пул памяти 48 ГБ, позволяя развернуть 70-миллиардную модель со скоростью 32 токена в секунду. Суть: Связка из двух RTX 3090 с мостом NVLink обеспечивает 48 ГБ общей видеопамяти с двунаправленной пропускной способностью шины 112 ГБ/с...
5 дней назад
• Вы подписаны
Qwen-2.5-Coder-32B на одной RTX 4090: 52 токена/сек в EXL2 против Claude 3.5 Sonnet
Инженерный бенчмарк Релиз открытой модели Qwen-2.5-Coder-32B разрушил монополию облачных гигантов на качественный автокомплит и рефакторинг кода: сетка с 32 млрд параметров укладывается в 24 ГБ видеопамяти обычной потребительской RTX 4090 и выдает свыше 50 токенов в секунду, решая в бенчмарке Aider 73.7% задач — вплотную к закрытому GPT-4o. Суть: Qwen-2.5-Coder-32B — плотная авторегрессионная модель, способная работать локально на одной карте RTX 3090/4090 без аренды облачных серверов. Ключевая метрика: Скорость 52 токена/сек при квантовании EXL2 4...
6 дней назад
• Вы подписаны
DeepSeek-Coder-V2 в FP8: 21B активных весов против Claude 3.5 Sonnet на реальных PR
Инженерный бенчмарк В бенчмарке SWE-bench Verified открытая модель DeepSeek-Coder-V2 решает 40.0% реальных issue из GitHub-репозиториев, уступая проприетарному Claude 3.5 Sonnet (51.4%), но при разнице в стоимости API более чем в 20 раз по входу и в 50 раз по выходу. Суть: DeepSeek-Coder-V2 — открытая MoE-модель на 236 млрд параметров с активацией 21 млрд на токен. Ключевая метрика: 40.0% в SWE-bench Verified и 73.7% в Aider Polyglot при цене $0.14/$0.28 за 1M токенов. Главный вывод: Модель пригодна для 80% рутинных PR и код-ревью в CI/CD, где Sonnet 3...
6 дней назад
• Вы подписаны
MICrONS и H01: 1,4 ПБ данных на 1 мм³ коры — почему архитектура мозга ломает трансформеры
Аналитика первоисточников Датасет Google Research и Harvard (H01), оцифровавший 1 мм³ височной коры человека в разрешении 4 нанометра, весит 1,4 петабайта и содержит 57 000 клеток и 150 миллионов синапсов — в пересчете на плотность соединений это эквивалентно размещению памяти Llama-3-70B в объеме песчинки. TL;DR: Замеры графа связности H01 выявили паттерны, отсутствующие в современных LLM: аксоны с 50+ дублирующими синапсами на один дендрит и рекуррентные тормозные кольца. Прямой перенос биологической...
1 неделя назад
• Вы подписаны
25 автономных нейросетей поселили в виртуальном городе: как ИИ начал строить социум, сплетничать и устраивать выборы
Что произойдет, если поселить два десятка автономных языковых моделей в уютный пиксельный городок, дать каждой уникальную предысторию, работу и характер, а затем просто отпустить управление? Исследователи из Стэнфордского университета и Google провели один из самых показательных социальных экспериментов в истории компьютерных наук. В виртуальном мире Smallville 25 генеративных агентов начали самостоятельно знакомиться, передавать городские сплетни, организовывать вечеринки и даже вести предвыборную гонку без единой строчки жестко запрограммированного сценария...
