Найти в Дзене
Покупайте СтеллыИ дарите их за контент
4 часа назад
 • Вы подписаны

Qwen 4 ждут в октябре на уровне DEEPSEEK и GLM

Осень — большой сезон для открытых весов, и главное ожидание — Qwen 4. • Qwen 4 — ждут октябрь–начало ноября: Alibaba, по данным @kimmonismus, подтвердила тренировку, даты релиза нет • Линейка — в твиттере перечисляют 27B, Flash, Plus, Max; размеров, контекста и весов пока нет • Прогноз — от плотной 27B ждут 40–42 балла в индексе Artificial Analysis (@analogalok) • Кто ещё — GLM-5...

16 часов назад
 • Вы подписаны

Пользуемся бесплатно топовй нейронкой до 13 октября

Ant Group раздаёт свою 560B-модель Ling-3.1-flash бесплатно две недели — сразу в нескольких кодинг-агентах. • 560B параметров всего и 25B активных на токен — в 4,5 раза крупнее прошлой Ling 3.0 Flash (124B) • Бесплатно до 13 октября: Cline, Vercel AI Gateway, Novita и OpenRouter с ценой $0/$0 • 262K контекста в бесплатном окне, полный 1M обещают после перехода на платный тариф (TechNode) • 41,1 в Intelligence Index Artificial Analysis — что-то между Deepseek v4...

17 часов назад
 • Вы подписаны

Google вывела первые TPU в КОСМОС

Google вывела на орбиту первые свои TPU — четыре чипа на связи, но дольше 15 минут подряд они не работают. • Что на орбите — спутник MVP размером с холодильник, четыре Trillium TPU: мощность как у облачного среза TPU v6e-4, панели примерно на 1 кВт • Запуск — 1 октября, Falcon 9 в миссии Transporter-18, спутник собран с Planet; Google подтвердила контакт • 15 минут и стоп — столько чипы считают, потом уходят в тепловое выключение: в вакууме тепло снимают только радиаторами и тепловыми трубками...

18 часов назад
 • Вы подписаны

Соавтор AlphaGo ушёл из DeepMind строить рассуждающую модель

Соавтор AlphaGo Тор Граепель ушёл из Google DeepMind и объяснил в MIT Technology Review, почему нынешние LLM не рассуждают. • Ход 37 с Ли Седолем: сеть-интуиция оценила его как 1 шанс из 10 000, выбрал его перебор по дереву • Нет явного состояния: не видно, какие гипотезы модель держит и насколько в них уверена • Chain of thought — тот же next-token, только длиннее: нередко ответ приходит одним путём, а отчёт пишется...

1 день назад
 • Вы подписаны

Модель Nvidia стала членом Коммунистической Партии Китая

Дообучение на чужих данных приносит в модель чужую политику. У открытой Nemotron Cascade 2 от Nvidia Aleph Alpha нашла тезисы КПК в 17% ответов. • 967 промптов про Тайвань, Тяньаньмэнь и Синьцзян: сбалансированных ответов у шести китайских моделей всего 17–41% • Две трети вопросов DeepSeek V4 Pro отклоняет — на них он отказывается отвечать • 17% ответов Nemotron повторяют партийные тезисы: в его SFT-данных ~3500 строк из 9.3 млн сгенерированы DeepSeek и Qwen • Сравнение — Claude Sonnet 5: 70% сбалансированных ответов, Mistral Small: 92% На просьбу собрать урок про культ личности Си Qwen 3...

1 день назад
 • Вы подписаны

Открытая модель для поиска уязвимостей в 31 раз дешевле Opus 5

Cantina Security выложила apex-flash-1 — открытую модель (MIT) для поиска и эксплуатации уязвимостей. Это RL-дообучение GLM-5.3-Flash: 320B параметров, 18B активных. • 40 из 60 отложенных кейсов, 66.7% — у Claude Opus 5 High 43/60 (71.7%) • $2.38 за прогон 60 задач против $74.68 у Opus 5 — в 31 раз дешевле • 60% и $4.56 у базовой GLM-5.3-Flash: дообучение обыграло свою базу • GRPO...

Покупайте СтеллыИ дарите их за контент