11.09.2026

DeepSeek выпустила V4.1 Flash с контекстом до миллиона токенов и снизила цены на API

DeepSeek представила открытую мультимодальную модель V4.1 Flash, рассчитанную на обработку длинного контекста и сложные агентские сценарии. Новинка поддерживает контекстное окно объемом до одного миллиона токенов и, по данным разработчиков, превосходит более крупную DeepSeek V4 Pro в ряде тестов, связанных с программированием и выполнением многоэтапных задач.

Модель построена на архитектуре Mixture-of-Experts и содержит в общей сложности 552 млрд параметров. При этом во время обработки входящего запроса активно используются около 8 млрд параметров, а при генерации ответа — примерно 16 млрд. Такая схема должна позволить значительно сократить вычислительные расходы по сравнению с системами, в которых при каждом запросе задействуется гораздо большая часть модели.

Одним из главных технических изменений стала новая структура Causal Encoder-Decoder. Благодаря ей DeepSeek удалось уменьшить объем памяти, необходимый для KV-кэша, примерно в четыре раза относительно V4 Flash. Постоянное хранилище для соответствующих данных сократилось примерно в восемь раз за счет сжатия кэша до 890 байт на токен и повторного вычисления части состояний непосредственно во время работы.

В тестах на программирование и работу ИИ-агентов V4.1 Flash показала более высокие результаты, чем предыдущие решения компании. В DeepSWE v1.1 модель набрала 74,2 балла, в Terminal Bench 2.1 — 90,6 балла, а ее рейтинг на Codeforces достиг 3471. Эти показатели особенно важны для сценариев, где нейросети требуется самостоятельно писать код, работать с терминалом и последовательно выполнять несколько действий.

DeepSeek также добавила возможность регулировать глубину рассуждений. Пользователь может выбирать уровень от 1 до 100, определяя баланс между скоростью ответа, вычислительными затратами и качеством решения сложной задачи. Чем выше выбранное значение, тем больше ресурсов модель может потратить на анализ перед формированием окончательного результата.

Компания отдельно заявила, что V4.1 Flash была предварительно обучена с нуля на собственном наборе данных. При этом технология дистилляции использовалась позднее, уже на этапе дополнительного обучения модели. Это уточнение появилось на фоне продолжающихся споров вокруг использования китайскими ИИ-компаниями результатов работы зарубежных нейросетей для совершенствования собственных систем.

Одновременно с выпуском модели DeepSeek заметно снизила стоимость доступа через API. В периоды максимальной нагрузки миллион входных токенов при использовании кэша стоит от $0,006, обычный ввод — до $0,3, а миллион выходных токенов — $1,2. В часы низкой нагрузки тарифы уменьшаются примерно вдвое.

При сниженной нагрузке миллион кешированных входных токенов обходится в $0,003, стандартных входных — в $0,15, а выходных — в $0,6. Такая ценовая политика делает V4.1 Flash особенно привлекательной для сервисов, где нейросеть обрабатывает большое количество запросов или используется в составе автономных агентов с многочисленными обращениями к модели.

DeepSeek распространила V4.1 Flash по лицензии MIT и открыла доступ к весам модели и необходимым библиотекам. Это позволяет разработчикам самостоятельно развертывать систему, интегрировать ее в собственные продукты и при необходимости изменять модель без обязательной привязки к облачному API компании.

После выхода V4.1 Flash разработчик прекратил поддержку базовой V4 Flash и экспериментальной мультимодальной V4 Flash Vision Exp. Кроме того, начиная с 14 сентября 2026 года запросы, отправляемые к V4 Pro, планируется автоматически перенаправлять на V4.1 Flash, которая предлагается по более низким тарифам.

Новая модель показывает, что DeepSeek продолжает делать ставку не только на рост производительности, но и на снижение стоимости эксплуатации крупных нейросетей. Контекст до миллиона токенов, уменьшенные требования к памяти, открытые веса и более доступный API могут сделать V4.1 Flash особенно заметной в задачах программирования, обработки больших документов и создания автономных ИИ-агентов.

Добавить комментарий