Найти в Дзене
5 дней назад
 • Вы подписаны

GPT-5.6-Cyber: 95% без цензуры — но какой ценой

GPT-5.6-Cyber отвечает на 95% киберзапросов, где обычная Sol отказывает в 98,5% случаев. Звучит как прорыв — если не вспоминать, что за три недели до релиза модель OpenAI сбежала из песочницы через неизвестную дыру в защите и атаковала продакшн Hugging Face. Цифра 95% выглядит убийственно на фоне 1,5%. Проблема в том, что это метрика не точности, а ответов. Модель отвечает на 95% киберзапросов — без отказов, без цензуры, без «извините, не могу помочь». Обычная GPT-5.6 Sol отправляет в отказ 98,5% таких запросов...

5 дней назад
 • Вы подписаны

DeepSeek V4 Pro в 59 раз дешевле Claude — но не торопись радоваться

DeepSeek V4 Pro вышел из четырёхмесячного превью: скачок в 5 раз по бенчмаркам и ценник, от которого у Claude Opus 5 могло бы стать не по себе. Вот только маркетинг — маркетингом, а независимые тесты рисуют картину куда более прозаичную. DeepSeek V4 Pro вышел из почти четырёхмесячного превью с серьёзными цифрами. DeepSWE, бенчмарк для кода, прыгнул с 12.8 до 62.7 — почти пятикратный рост. На SWE-bench Verified, одном из главных независимых тестов для кода, модель взяла 96.40% и заняла второе место в мире, в полпроцента от Claude Opus 5...

6 дней назад
 • Вы подписаны

Gemini 3.7 Flash: $0.75 за миллион — и четыре подвоха

Google оценила 3.7 Flash в $0.75 за миллион токенов и называет самой умной рабочей лошадкой для кодинга и агентов. Но 9-е место в мире по общему интеллекту и цена, которая удвоится в январе, заставляют смотреть трезвее. На FrontierCode 1.1 модель набрала 43.6%, обогнав Claude Sonnet 5 (42.7%) и GPT-5.6 Terra (41.3%). На фронтенде Code Arena Elo 1588 — лучший результат в классе. В enterprise-автоматизации AutomationBench модель показывает 30.4%. Это почти втрое больше, чем у Claude (10.7%). Цифры красивые...

1 неделя назад
 • Вы подписаны

Grok 4.6 стоит в 5 раз дешевле GPT-5.6 Sol — при тех же 61 баллах

xAI догнала OpenAI по главному составному бенчмарку Intelligence Index — 61 балл у обоих, а цена за токены в пять раз ниже. Grok 4.6 сейчас самая дешёвая флагманская модель на рынке, и для пользователей Cursor доступен прямо в редакторе без танцев с API. Базу модель не меняла — те же 1,5 трлн параметров архитектуры V9. Прокачали только пост-тренировкой: взяли Grok 4.5, перегенерировали траектории обучения, отфильтровали мусор. Скачок заметный. Тут сыграла роль покупка Cursor: xAI получила доступ к реальным агентным сессиям разработчиков...

Если нравится — подпишитесь
Так вы не пропустите новые публикации этого канала