DeepSeek (кит. 深度求索) — китайская компания в области искусственного интеллекта, основанная в 2023 году . Специализируется на разработке больших языковых моделей (LLM) и мультимодальных систем. Компания получила широкую известность благодаря открытой публикации весов моделей и высокой экономической эффективности, что в конце 2024 — начале 2025 года привело к корректировке цен на рынке искусственного интеллекта .

История

Основателем DeepSeek является предприниматель и сооснователь хедж-фонда High-Flyer, занимающегося количественным трейдингом, Лян Вэньфэн . Весной 2023 года High-Flyer выделил свой отдел исследований в области ИИ в отдельную компанию, которая была учреждена в мае того же года как DeepSeek AI . К 2025 году штат компании вырос до примерно 160 сотрудников .

В отличие от большинства стартапов, DeepSeek финансируется из бюджета High-Flyer, что, по заявлению основателя, позволяет компании сосредоточиться на долгосрочных целях, а не на сиюминутной коммерциализации .

В январе 2025 года, после выпуска модели DeepSeek-R1, компания вызвала резонанс в технологическом и финансовом мире. Сообщения о том, что обучение модели, сопоставимой по возможностям с GPT-4, обошлось менее чем в 6 миллионов долларов (по сравнению с оценками более 100 миллионов долларов для GPT-4), привели к падению акций технологических гигантов и заставили отрасль пересмотреть парадигму «больше вычислений — лучше модель» .

Долгое время DeepSeek не привлекала внешнего финансирования, однако в 2026 году изменила эту стратегию. В июле 2026 года оценочная стоимость компании была раскрыта через публичную документацию: инвестиционный фонд, в котором участвовал китайский производитель багажа Anhui Korrun, потратил 2,9 млрд юаней на приобретение 0,8265% акций DeepSeek . Таким образом, оценка компании составила приблизительно 350,88 млрд юаней (около 51,82 млрд долларов США) .

Архитектурные особенности

DeepSeek использует ряд инновационных подходов в архитектуре моделей и методах обучения :

  • Mixture-of-Experts (DeepSeekMoE) — большинство флагманских моделей DeepSeek используют архитектуру смеси экспертов (MoE). В отличие от «плотных» моделей, где при обработке запроса активируются все параметры, в моделях MoE для каждого токена активируется лишь небольшая часть специализированных подсетей («экспертов»). Это позволяет активировать лишь часть из сотен миллиардов параметров, резко снижая вычислительные затраты .
  • Multi-Head Latent Attention (MLA) — метод сжатия KV-кэша в латентный вектор, который экономит до 93% памяти и позволяет использовать окно контекста до 1 млн токенов. Эта технология является ключевой для эффективной работы с длинными текстами .
  • FP8 обучение и мультитокенное прогнозирование — в моделях семейства V3 используется смешанная точность FP8 (8-битные числа с плавающей запятой) и одновременное прогнозирование нескольких токенов, что ускоряет обучение и логический вывод (inference) .

Семейство моделей

Основные модели DeepSeek
Модель Год выпуска Параметры Особенности
DeepSeek LLM 2023 7B / 67B Первая двуязычная (китайский/английский) модель, превзошедшая LLaMA-2 70B по ряду задач
DeepSeek-Coder 2023 1.3B – 33B Специализированные модели для программирования; Coder-V2 поддерживает 338 языков программирования
DeepSeek-V2 май 2024 236B (21B активных) MoE-модель с архитектурой MLA; обучена на 8,1 трлн токенов
DeepSeek-V3 декабрь 2024 671B (37B активных) Флагманская модель; обучение на Nvidia H800 обошлось в ~2,8 млн GPU-часов (~$5,5 млн)
DeepSeek-R1 январь 2025 671B (37B активных) Модель для логического вывода (reasoning), обученная с помощью подкрепления (RL)
DeepSeek-V4 Preview апрель 2026 284B (13B) / 1.6T (49B) Модели с окном контекста 1 млн токенов; Pro и Flash версии
DeepSeek-VL / VL2 2024 до 4.5B активных Мультимодальные модели (зрение + язык)
DeepSeek-Math 7B 2024 7B Специализированная модель для математических задач; достигла 51,7% на бенчмарке MATH

Основные возможности

DeepSeek предоставляет широкий спектр функций как для конечных пользователей, так и для разработчиков :

  • Режим мышления (Thinking Mode) — перед выдачей финального ответа модель генерирует цепочку рассуждений, что повышает точность на сложных задачах (математика, логика, программирование) .
  • Помощь в программировании — написание, отладка и объяснение кода на множестве языков программирования .
  • Обработка длинных текстов — написание эссе, статей, рефератов; суммаризация больших документов .
  • Решение задач — математика, алгебра, логические задачи с пошаговым решением .
  • Мультиязычность — свободное владение английским, китайским и многими другими языками .
  • Структурированный вывод — поддержка вывода в формате JSON и других структурированных форматах .
  • Инструменты (Tool Calls) — поддержка вызова внешних инструментов и функций через API .

API и цены

DeepSeek предоставляет публичный API для своих моделей, совместимый с форматом OpenAI и Anthropic .

Цены на API DeepSeek (за 1 млн токенов)
Модель Вход (cache miss) Вход (cache hit) Выход
deepseek-v4-flash $0.14 $0.0028 $0.28
deepseek-v4-pro $0.435 $0.003625 $0.87

Модели поддерживают окно контекста до 1 млн токенов. API позволяет управлять режимом мышления через параметр `thinking` и уровнем усилия рассуждений через `reasoning_effort` .

Открытость и лицензирование

Большинство моделей DeepSeek распространяются под лицензиями MIT или Apache 2.0, разрешающими коммерческое использование. Компания публикует веса моделей на Hugging Face и GitHub, однако сохраняет закрытыми полные наборы данных и конвейеры обучения («открытые веса, но не полностью открытый исходный код») .

Влияние и восприятие

DeepSeek позиционируется как один из ключевых игроков в глобальной гонке ИИ, представляя альтернативу американским компаниям (OpenAI, Anthropic) . Его модели, работающие на китайских чипах Huawei (Ascend), демонстрируют рост автономии Китая в области ИИ . По состоянию на июль 2026 года компания оценивается в ~$52 млрд и готовится к выходу на IPO .

См. также