
Обучение языковой модели с нуля доступно немногим компаниям. Дообучение готовой открытой модели стоит на несколько порядков дешевле и чаще подходит для прикладной задачи.
Стоимость обучения с нуля
Опубликованные оценки сильно различаются, потому что компании считают расходы по-разному. Для известных моделей приводят такие суммы:
- GPT-3, около $4,3 млн;
- GPT-4, около $80 млн;
- Grok-2, около $107 млн;
- Llama 3.1 405B, от $170 млн;
- Gemini 1.0 Ultra, около $192 млн.
Дарио Амодей допускал, что к 2027 или 2028 году обучение крупнейшей модели может стоить $100 млрд. Это прогноз, а не объявленный бюджет конкретного проекта.
В цену входят ускорители, подготовка данных, работа инженеров, электроэнергия и охлаждение. Итог зависит от числа параметров, объёма обучающих данных, длины последовательностей и количества неудачных запусков.
Почему оценки расходятся
DeepSeek сообщала примерно о $6 млн вычислительных затрат на обучение V3. Эта цифра не обязательно включает сбор данных, исследования, оборудование и предыдущие эксперименты. Сравнивать её с полной стоимостью другой модели без единой методики нельзя.
Архитектура Mixture of Experts снижает объём вычислений на один токен, потому что для запроса активируется только часть параметров. Но экономия зависит от реализации и инфраструктуры.
Сколько стоит fine-tuning
Для дообучения не нужно повторять весь цикл. Примерные диапазоны для облачных GPU:
- LoRA для Llama 3 8B, от $500 до $1 500;
- полное дообучение Llama 3 70B, от $10 000 до $30 000.
Небольшой эксперимент может стоить гораздо меньше. В одном описанном случае Mistral 7B дообучили на одном NVIDIA A10G менее чем за $10 вычислений. Такая цена не включает подготовку датасета и работу специалиста.
Перед дообучением посчитайте стоимость разметки, экспериментов, оценки качества и последующего запуска модели. Именно эти статьи часто оказываются дороже одного тренировочного прогона.

