DeepSeek
DeepSeek (кит. 深度求索) — китайская компания в области искусственного интеллекта, основанная в 2023 году . Специализируется на разработке больших языковых моделей (LLM) и мультимодальных систем. Компания получила широкую известность благодаря открытой публикации весов моделей и высокой экономической эффективности, что в конце 2024 — начале 2025 года привело к корректировке цен на рынке искусственного интеллекта .
История
Основателем DeepSeek является предприниматель и сооснователь хедж-фонда High-Flyer, занимающегося количественным трейдингом, Лян Вэньфэн . Весной 2023 года High-Flyer выделил свой отдел исследований в области ИИ в отдельную компанию, которая была учреждена в мае того же года как DeepSeek AI . К 2025 году штат компании вырос до примерно 160 сотрудников .
В отличие от большинства стартапов, DeepSeek финансируется из бюджета High-Flyer, что, по заявлению основателя, позволяет компании сосредоточиться на долгосрочных целях, а не на сиюминутной коммерциализации .
В январе 2025 года, после выпуска модели DeepSeek-R1, компания вызвала резонанс в технологическом и финансовом мире. Сообщения о том, что обучение модели, сопоставимой по возможностям с GPT-4, обошлось менее чем в 6 миллионов долларов (по сравнению с оценками более 100 миллионов долларов для GPT-4), привели к падению акций технологических гигантов и заставили отрасль пересмотреть парадигму «больше вычислений — лучше модель» .
Долгое время DeepSeek не привлекала внешнего финансирования, однако в 2026 году изменила эту стратегию. В июле 2026 года оценочная стоимость компании была раскрыта через публичную документацию: инвестиционный фонд, в котором участвовал китайский производитель багажа Anhui Korrun, потратил 2,9 млрд юаней на приобретение 0,8265% акций DeepSeek . Таким образом, оценка компании составила приблизительно 350,88 млрд юаней (около 51,82 млрд долларов США) .
Архитектурные особенности
DeepSeek использует ряд инновационных подходов в архитектуре моделей и методах обучения :
- Mixture-of-Experts (DeepSeekMoE) — большинство флагманских моделей DeepSeek используют архитектуру смеси экспертов (MoE). В отличие от «плотных» моделей, где при обработке запроса активируются все параметры, в моделях MoE для каждого токена активируется лишь небольшая часть специализированных подсетей («экспертов»). Это позволяет активировать лишь часть из сотен миллиардов параметров, резко снижая вычислительные затраты .
- Multi-Head Latent Attention (MLA) — метод сжатия KV-кэша в латентный вектор, который экономит до 93% памяти и позволяет использовать окно контекста до 1 млн токенов. Эта технология является ключевой для эффективной работы с длинными текстами .
- FP8 обучение и мультитокенное прогнозирование — в моделях семейства V3 используется смешанная точность FP8 (8-битные числа с плавающей запятой) и одновременное прогнозирование нескольких токенов, что ускоряет обучение и логический вывод (inference) .
Семейство моделей
| Модель | Год выпуска | Параметры | Особенности |
|---|---|---|---|
| DeepSeek LLM | 2023 | 7B / 67B | Первая двуязычная (китайский/английский) модель, превзошедшая LLaMA-2 70B по ряду задач |
| DeepSeek-Coder | 2023 | 1.3B – 33B | Специализированные модели для программирования; Coder-V2 поддерживает 338 языков программирования |
| DeepSeek-V2 | май 2024 | 236B (21B активных) | MoE-модель с архитектурой MLA; обучена на 8,1 трлн токенов |
| DeepSeek-V3 | декабрь 2024 | 671B (37B активных) | Флагманская модель; обучение на Nvidia H800 обошлось в ~2,8 млн GPU-часов (~$5,5 млн) |
| DeepSeek-R1 | январь 2025 | 671B (37B активных) | Модель для логического вывода (reasoning), обученная с помощью подкрепления (RL) |
| DeepSeek-V4 Preview | апрель 2026 | 284B (13B) / 1.6T (49B) | Модели с окном контекста 1 млн токенов; Pro и Flash версии |
| DeepSeek-VL / VL2 | 2024 | до 4.5B активных | Мультимодальные модели (зрение + язык) |
| DeepSeek-Math 7B | 2024 | 7B | Специализированная модель для математических задач; достигла 51,7% на бенчмарке MATH |
Основные возможности
DeepSeek предоставляет широкий спектр функций как для конечных пользователей, так и для разработчиков :
- Режим мышления (Thinking Mode) — перед выдачей финального ответа модель генерирует цепочку рассуждений, что повышает точность на сложных задачах (математика, логика, программирование) .
- Помощь в программировании — написание, отладка и объяснение кода на множестве языков программирования .
- Обработка длинных текстов — написание эссе, статей, рефератов; суммаризация больших документов .
- Решение задач — математика, алгебра, логические задачи с пошаговым решением .
- Мультиязычность — свободное владение английским, китайским и многими другими языками .
- Структурированный вывод — поддержка вывода в формате JSON и других структурированных форматах .
- Инструменты (Tool Calls) — поддержка вызова внешних инструментов и функций через API .
API и цены
DeepSeek предоставляет публичный API для своих моделей, совместимый с форматом OpenAI и Anthropic .
| Модель | Вход (cache miss) | Вход (cache hit) | Выход |
|---|---|---|---|
| deepseek-v4-flash | $0.14 | $0.0028 | $0.28 |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 |
Модели поддерживают окно контекста до 1 млн токенов. API позволяет управлять режимом мышления через параметр `thinking` и уровнем усилия рассуждений через `reasoning_effort` .
Открытость и лицензирование
Большинство моделей DeepSeek распространяются под лицензиями MIT или Apache 2.0, разрешающими коммерческое использование. Компания публикует веса моделей на Hugging Face и GitHub, однако сохраняет закрытыми полные наборы данных и конвейеры обучения («открытые веса, но не полностью открытый исходный код») .
Влияние и восприятие
DeepSeek позиционируется как один из ключевых игроков в глобальной гонке ИИ, представляя альтернативу американским компаниям (OpenAI, Anthropic) . Его модели, работающие на китайских чипах Huawei (Ascend), демонстрируют рост автономии Китая в области ИИ . По состоянию на июль 2026 года компания оценивается в ~$52 млрд и готовится к выходу на IPO .