Сбер представил новую флагманскую мультимодальную модель GigaChat 3.5 Reasoning и опубликовал ее веса в открытом доступе по лицензии MIT. По заявлению разработчиков, это первая отечественная открытая модель, изначально обученная работать в режиме рассуждений: перед формированием ответа она может разбивать задачу на отдельные этапы, проверять промежуточные выводы и корректировать ошибки.
В основе GigaChat 3.5 Reasoning используется архитектура Mixture-of-Experts с общим объемом 432 млрд параметров. При обработке каждого токена задействуются около 28 млрд параметров, что позволяет снизить вычислительные затраты по сравнению с моделью, в которой весь набор параметров активируется постоянно. Такой подход сегодня применяется во многих крупных ИИ-системах.
Одним из ключевых технических изменений стало гибридное внимание, объединяющее Multi-head Latent Attention и GatedDeltaNet. Сбер утверждает, что новая архитектура позволила примерно в четыре раза сократить размер KV-кэша по сравнению с GigaChat 3.1 Ultra. Это уменьшает нагрузку на память видеокарт при обработке длинного контекста и потенциально упрощает развертывание модели.
На тестах по программированию и выполнению сложных инструкций новая версия заметно превзошла предыдущее поколение. В LiveCodeBench v6 показатель вырос с 56 до 85 баллов, в IFBench — с 44 до 77, а в Natural Plan — с 64 до 80. В MMLU-Pro базовая версия GigaChat 3.5 Reasoning набрала 74,5 балла против 65,8 у DeepSeek V4 Flash Base.
Разработчики отдельно отмечают эффективность модели при решении математических задач. По внутренним оценкам Сбера, GigaChat 3.5 Reasoning расходует в среднем на 37% меньше токенов на процесс рассуждения, чем DeepSeek V4 Flash Preview, при сопоставимой точности. Это может быть особенно важно при масштабном использовании модели, поскольку длина рассуждений напрямую влияет на вычислительные расходы.
На более сложных независимых тестах модель также приблизилась к крупным зарубежным системам, хотя прямое сравнение остается условным из-за различий в методиках оценки. В GPQA-Diamond результат GigaChat 3.5 Reasoning составил 82,3%, а в олимпиадном математическом тесте AIME 2025 — 89% в режиме mean@32. На SWE-bench Verified, где проверяется способность исправлять реальные ошибки в программных проектах, модель набрала 64,7%.
При этом по ряду тестов зарубежные флагманские модели пока сохраняют преимущество. Например, результаты ведущих систем OpenAI, Google и Anthropic на отдельных заданиях по научным вопросам и программированию остаются выше. Однако разница в некоторых сценариях стала заметно меньше, чем у предыдущих поколений российских открытых моделей.
GigaChat 3.5 Reasoning уже доступна в веб-версии GigaChat, где режим рассуждений можно включить отдельно. Веса опубликованы в форматах bf16 и GGUF, что позволяет разработчикам самостоятельно запускать и дорабатывать модель на собственной инфраструктуре. В дальнейшем Сбер также планирует предоставить коммерческий доступ через API.
Одновременно компания продолжает расширять семейство GigaChat за пределы текстовых моделей. В частности, был представлен GigaChat Audio, предназначенный для анализа голосовых записей. Он способен распознавать эмоции, искать отдельные фрагменты в длинных аудиофайлах и запоминать факты из предыдущих голосовых сообщений для использования в дальнейших диалогах.
Выход GigaChat 3.5 Reasoning показывает, что российские разработчики все активнее переходят к открытым большим моделям с полноценными механизмами рассуждений. Возможность свободно получить веса по лицензии MIT делает новую систему интересной не только для конечных пользователей, но и для компаний и исследователей, которым необходим локальный запуск, собственная настройка и интеграция ИИ в закрытую инфраструктуру.