ИИ-агент — это не один запрос к модели, а целый цикл: он планирует действие, вызывает инструмент, читает результат и снова рассуждает. Поэтому бизнесу важна не цена токена сама по себе, а стоимость успешно завершённой задачи. В Microsoft Foundry экономику агентных систем предлагают оптимизировать на уровне каждого запроса. Это позволяет сокращать расходы не разово, а на каждом шаге работы агента — без компромиссов в качестве, безопасности и скорости ответа. Типичный прототип строится разумно: команда...
SunN1nja
Google представила Gemini 3.5 Transcribe — ИИ для точной и «умной» расшифровки речи
Google представила Gemini 3.5 Transcribe — новую модель распознавания речи, которая превращает живую, неидеальную запись в аккуратный структурированный текст. Она умеет работать с шумом, профессиональными терминами, оговорками и переключением языков, а также доступна разработчикам через Gemini API. Обычные системы speech-to-text часто дословно фиксируют всё, что произнёс человек: «э-э», паузы, повторения, оборванные фразы и самокоррекции. Gemini 3.5 Transcribe создана с другим подходом. Модель должна понимать естественную речь и сразу выдавать чистый, отформатированный текст...
NVIDIA представила NVHBM: память для ИИ-чипов станет быстрее и экономичнее
Развитие ИИ упирается уже не только в мощность вычислительных чипов. Агентные системы и модели с триллионами параметров требуют, чтобы процессоры, память, накопители, сеть и программное обеспечение проектировались как единая инфраструктура. NVIDIA представила технологию NVHBM, которая должна изменить устройство высокоскоростной памяти в полузаказных ИИ-системах. NVHBM — это новое поколение высокоскоростной памяти, разработанное в рамках NVIDIA NVLink Fusion. Технология ориентирована на гиперскейлеров и компании, создающие собственные специализированные ускорители для искусственного интеллекта...
Z.ai представила GLM-5.3-Flash: мультимодальная MoE-модель на 320 млрд параметров с контекстом в 1 млн токенов
Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель семейства GLM-5 и одновременно наиболее доступную из своих моделей, ориентированных на программирование. Новинка умеет работать не только с текстом, но и с изображениями и видео, поддерживает контекст до 1 048 576 токенов, а её веса опубликованы по лицензии MIT. Модель интересна сразу по двум причинам: она заявляет производительность, близкую к флагманским закрытым системам в задачах разработки, и при этом доступна как через API, так и для самостоятельного развёртывания...
