Сколько видеопамяти нужно для локальных LLM в 2026 году

Практический минимум на 2026 год — 16 ГБ видеопамяти. В них помещается модель на 20–30 миллиардов параметров в 4-битном кванте вместе с длинным контекстом. На 8 ГБ живут модели до 8B и короткий контекст, на 12 ГБ — до 14B. Всё, что крупнее 32B, упирается уже не в видеокарту, а в объединённую память: Apple Silicon, Ryzen AI Max или DGX Spark.
Обновлено 2 августа 2026. Пересчитана формула — прошлая версия закладывала фиксированные 2 ГБ на контекст, и это неверно. Добавлены разделы про KV-кэш, MoE-модели, пропускную способность памяти, объём оперативной памяти и ситуацию с ценами. Исправлена ошибка: у RTX 5090 не 24 ГБ, а 32.
Короткий ответ по объёмам
| Видеопамять | Что реально запускается | Оговорка |
|---|---|---|
| 8 ГБ | Плотные модели до 8B в Q4, контекст 4–8K | Контекст придётся держать коротким |
| 12 ГБ | До 14B в Q4 либо 8B с контекстом 32K | MoE уровня gpt-oss-20b уже не влезает |
| 16 ГБ | gpt-oss-20b целиком, плотные 14B свободно, 30B-MoE впритык | Рабочий минимум 2026 года |
| 24 ГБ | Плотные 32B в Q4 с длинным контекстом | В линейке RTX 50 такого объёма нет вообще |
| 32 ГБ | 32B комфортно, 70B — с выгрузкой части слоёв | Потолок одиночной потребительской карты |
| 64–128 ГБ объединённой | До 120B в MoE-формате целиком | Влезет всё, вопрос в скорости |
Строчка про 24 ГБ требует пояснения, потому что она ломает привычную логику апгрейда. RTX 5060 Ti выпускается на 8 и 16 ГБ, RTX 5070 несёт 12, RTX 5070 Ti и RTX 5080 по 16, RTX 5090 — 32 ГБ GDDR7 (NVIDIA). Ступени на 24 ГБ в поколении Blackwell не существует. Хотите её — либо б/у RTX 3090 и 4090, либо профессиональные RTX PRO по другому прайсу.
Из чего складывается расход видеопамяти
Слагаемых три: веса модели, кэш контекста и служебный оверхед. Про последний вспоминают обычно уже после того, как модель не влезла.
Веса модели. Считаются в лоб: количество параметров умножаем на объём одного веса. В Q4_K_M, самом ходовом кванте, выходит примерно 0,56 байта на параметр, то есть на 72% меньше, чем в FP16 (Will It Run AI).
| Квантование | Байт на параметр | Модель 8B | Модель 32B |
|---|---|---|---|
| FP16 | 2,0 | ~16 ГБ | ~64 ГБ |
| Q8_0 | 1,0 | ~8 ГБ | ~32 ГБ |
| Q4_K_M | ~0,56 | 4,9 ГБ | ~19 ГБ |
Реальный файл Llama 3.1 8B в Q4_K_M весит 4,9 ГБ — чуть больше расчётных 4,5, потому что эмбеддинги и часть слоёв внимания в K-квантах остаются в повышенной точности.
KV-кэш. Память под контекст. Растёт линейно с числом токенов и на длинных диалогах перевешивает саму модель.
Оверхед. Контекст CUDA, буферы активаций, служебные аллокации движка. Полгигабайта-гигабайт, которые невозможно спланировать заранее, но которые обязательно всплывут, когда вы подгоните модель впритык под объём карты.
Старая формула «параметры × 0,6 + 2 ГБ» неплохо угадывает первое слагаемое и полностью врёт про второе.
Почему контекст съедает больше, чем сама модель
KV-кэш хранит ключи и значения для каждого уже обработанного токена, чтобы не пересчитывать их заново на каждом шаге генерации. Формула считается точно:
KV-кэш (байт) = 2 × слои × KV-головы × размер головы × токены × байт на значение
Подставим Llama 3.1 8B: 32 слоя, 8 KV-голов, размер головы 128, FP16. Получаем 131 072 байта на один токен — ровно 128 КБ. Дальше умножаем на длину контекста:
| Контекст | KV-кэш в FP16 |
|---|---|
| 4K | 0,54 ГБ |
| 8K | 1,07 ГБ |
| 32K | 4,3 ГБ |
| 128K | 17,2 ГБ |
Вот и ответ, куда девается память. На 32K контекста кэш почти равен весу модели, на 128K — тяжелее её в три с половиной раза. Модель на 4,9 ГБ вместе с полным контекстом требует 22 ГБ, и никакая RTX 5070 Ti это не переварит. Цифры сходятся с практикой: у Llama-3-8B в Q4_K_M на 32K контекста кэш занимает около 4 ГБ (dev.to).
Спасают два обстоятельства. Первое: групповое внимание GQA. У той же Llama 3.1 8B 32 головы запросов, но всего 8 KV-голов, и кэш за счёт этого вчетверо меньше, чем был бы при классическом multi-head. Второе — квантование самого кэша. vLLM и TensorRT-LLM умеют держать его в FP8 или INT4, что срезает 50–75% объёма (llm-stats) при потерях качества, которые в обычном чате незаметны.
Закладывайте контекст под задачу, а не «на всякий случай». Если вы пишете код с моделью, 16–32K нужны реально. Если общаетесь в чате — 8K хватит с запасом, а сэкономленные гигабайты пойдут на модель покрупнее.
MoE сломал старую арифметику
Раньше связка была жёсткой: больше параметров — больше памяти и медленнее генерация. Mixture-of-Experts разорвал вторую половину, и это самое существенное изменение в теме за последние полтора года. Модель держит в памяти десятки «экспертов», а на каждый токен включает лишь несколько из них.
Qwen3-30B-A3B: 30 миллиардов параметров всего, 3,3 миллиарда активных на токен, около 19 ГБ в Q4_K_M и контекстное окно на 256K. gpt-oss-20b устроен так же — 3,6 миллиарда активных, родное квантование MXFP4 ужимает веса до 12–13 ГБ, и модель укладывается в 16 ГБ вместе со 128K контекста (IntuitionLabs).
Скорость при этом остаётся на уровне мелких моделей: gpt-oss-20b выдаёт около 225 токенов в секунду на RTX 4090 (runaihome). Двадцатимиллиардная модель работает как семимиллиардная.
Память под MoE нужна как под полную модель: все эксперты обязаны лежать в VRAM, иначе начнётся подкачка. А вот скорость считается по активным весам. Поэтому вопрос «сколько мне нужно видеопамяти» распался на два разных — сколько нужно, чтобы модель влезла, и сколько нужно, чтобы она шевелилась. Ответы больше не совпадают.
Объём говорит «влезет», пропускная способность — «как быстро»
Чтобы выдать один токен, движок обязан прогнать через шину памяти все активные веса. Отсюда грубый потолок скорости: пропускная способность делить на объём активных весов. Всё остальное — оптимизации вокруг этого предела.
| Платформа | Память | Пропускная способность |
|---|---|---|
| RTX 5090 | 32 ГБ GDDR7 | 1792 ГБ/с (спецификация) |
| DGX Spark | 128 ГБ LPDDR5x | ~273 ГБ/с (NVIDIA) |
| Ryzen AI Max+ 395 | до 128 ГБ LPDDR5X | 256 ГБ/с в теории, 212–215 на практике (llm-tracker) |
Разрыв в шесть-семь раз объясняет вещи, которые иначе выглядят абсурдно. Плотная Llama 70B на DGX Spark идёт со скоростью около 2,7 токена в секунду: влезает целиком, но течёт через узкую шину. А gpt-oss-120b на том же устройстве выдаёт 35–50 токенов, потому что активных весов у неё в разы меньше. Подробный разбор этого парадокса — в статье какие LLM потянет RTX Spark.
Меня в своё время удивило, насколько плохо этот момент отражён в обзорах. Объём памяти пишут в первой строке спецификации, пропускную способность прячут в конец таблицы, а на скорость ответа она влияет сильнее.
Разбор по объёмам
8 ГБ
Нижняя рабочая граница, и слово «рабочая» тут с натяжкой. Плотные модели до 8B в Q4 сюда влезают, но с контекстом 4–8K: на 32K кэш уже не поместится рядом с весами. Для чат-бота, суммаризации коротких текстов и знакомства с темой достаточно. Для кода — тесно.
Карт с 8 ГБ в продаже много, и они дешёвые. Если это ваша единственная опция, начните с моделей класса 4B и посмотрите, хватает ли качества.
12 ГБ
Плотные 14B в Q4 либо 8B с приличным контекстом. Разумный компромисс, когда карта берётся ещё и под игры. Обидный момент: gpt-oss-20b в 12 ГБ не влезает, до него не хватает буквально пары гигабайт.
16 ГБ
Тот объём, который я советую как отправную точку. Причина конкретная: сюда помещается gpt-oss-20b целиком со 128K контекста, плотные 14B живут свободно, а 30B-MoE вроде Qwen3-30B-A3B заходит впритык при аккуратном обращении с контекстом. Плюс FLUX и SDXL для картинок работают без выгрузок.
В каталоге RTXSpark этот объём закрывают Palit RTX 5060 Ti 16 ГБ, самый доступный вариант, и MSI RTX 5070 Ti 16 ГБ, которая заметно быстрее на той же ёмкости. Остальные варианты собраны в разделе видеокарты.
24 ГБ
Плотные 32B в Q4 с длинным контекстом, комфортное дообучение через QLoRA. Проблема в том, что в актуальном поколении такой карты нет. Остаётся вторичный рынок с RTX 3090 и 4090 либо профессиональная линейка. Слухи про RTX 50 Super с 24 ГБ разбираю ниже, но полагаться на них при покупке сегодня я бы не стал.
32 ГБ
RTX 5090 и её 1792 ГБ/с — самая быстрая одиночная карта для локального инференса. Плотные 32B идут комфортно, 70B в Q4 требуют 43 ГБ и целиком не помещаются: часть слоёв придётся выгружать в оперативную память, и скорость просядет в разы.
Когда видеокарты кончаются: объединённая память
Модель на 70B в Q4_K_M весит 43,1 ГБ. Это больше любой потребительской видеокарты, и здесь начинается другая архитектура — общая память для процессора и графики.
Apple Silicon отдаёт под нужды графики системную память, так что 64 или 128 ГБ на M-чипе превращаются в рабочий объём для крупных моделей. AMD Ryzen AI Max+ 395 несёт до 128 ГБ, из которых до 96 конвертируются в VRAM через Variable Graphics Memory, и показывает около 100 токенов в секунду на Qwen3-30B (runaihome). NVIDIA DGX Spark — 128 ГБ с пропускной способностью около 273 ГБ/с.
Плата за объём — скорость. Ни одна из этих платформ близко не подходит к 1,8 ТБ/с дискретной карты. Выбор сводится к честному вопросу: вам нужна большая модель или быстрая? Развёрнутое сравнение подходов — в материале RTX Spark против Apple Silicon, а сами устройства собраны в разделе AI-станции.
Сколько нужно оперативной памяти
Минимальная конфигурация для запуска модели уровня 3B–7B в Q4 выглядит так: 16 ГБ системной памяти, современный процессор и видеокарта от 6 ГБ (overchat). Оперативная память нужна на двух этапах — при загрузке весов с диска и при выгрузке слоёв, которые не влезли в видеокарту.
Второй случай интереснее, потому что им можно пользоваться осознанно. llama.cpp и построенные на нём Ollama и LM Studio умеют размещать в VRAM только часть слоёв модели, а остальные считать на процессоре (параметр --n-gpu-layers). Модель на 20 ГБ запустится на карте с 12 ГБ, но каждый токен будет ходить через PCIe, и скорость упадёт кратно. Как способ попробовать модель, которая не влезает, приём рабочий. Жить в таком режиме постоянно тяжело.
32 ГБ оперативной снимают вопрос почти для любого сценария на потребительской карте.
Картинки и дообучение — другой профиль памяти
Генеративные модели изображений считают память иначе: KV-кэша там нет, зато веса грузятся целиком. FLUX.1-dev в fp8 занимает 11,9 ГБ, и на 8-гигабайтной карте работает через постоянную подкачку из оперативной памяти — медленно, но работает. Разбор установки со всеми подводными камнями — в гайде по ComfyUI и FLUX.
Дообучение требует ещё больше: к весам добавляются градиенты и состояния оптимизатора. QLoRA держит базовую модель замороженной в 4 битах и обучает только адаптеры, поэтому 7B укладывается примерно в 12 ГБ, а 13B просит от 20 (Spheron). Полное дообучение той же семёрки потребовало бы 100–120 ГБ, так что для домашних условий альтернативы адаптерам нет.
Что происходит с памятью и ценами в 2026
Производители памяти загружены заказами под дата-центры, и GDDR7 достаётся видеокартам по остаточному принципу. NVIDIA сократила отгрузки партнёрам примерно на 15–20%, а в июле цены на китайском рынке подскочили на 15–30% (Хабр). Трёхгигабайтные чипы GDDR7 стоят 60–70 долларов против примерно 20 за двухгигабайтные, и эта разница напрямую бьёт по картам с большим объёмом.
Отсюда судьба обновлённой линейки. По утечкам, RTX 50 Super должна была принести RTX 5080 Super и RTX 5070 Ti Super с 24 ГБ, а также RTX 5070 Super с 18 ГБ, но релиз сдвигается: свежие слухи называют CES 2027 (VideoCardz). Официально NVIDIA эти карты не анонсировала, так что любые даты и характеристики здесь остаются слухами.
Практический смысл: ждать удвоения гигабайтов за те же деньги в обозримом будущем не приходится. Планируйте исходя из того, что есть на полке сейчас.
Кому какой объём брать
Знакомитесь с локальным ИИ и бюджет жёсткий — 8–12 ГБ. Возьмите модель на 4–8B, короткий контекст, и посмотрите, закрывает ли она ваши задачи. Может выясниться, что большего и не надо.
Для работы с кодом и большими документами — 16 ГБ и ни граммом меньше. Длинный контекст съест разницу между 12 и 16 быстрее, чем вы успеете это заметить.
32 ГБ имеют смысл под плотные модели на 32B, дообучение на своих данных и генерацию видео. Альтернатива — б/у карта с 24 ГБ, если готовы к рискам вторичного рынка.
Модели на 70B и выше живут только в объединённой памяти. Дискретные карты в этой весовой категории кончились.
Частые вопросы
Хватит ли 8 ГБ видеопамяти для локальной LLM? Хватит для моделей до 8B в 4-битном кванте с контекстом 4–8K. Для кода и длинных документов будет тесно: KV-кэш на 32K контекста один займёт больше 4 ГБ. Начать и понять, нужно ли вам это вообще, — вполне достаточно.
Почему модель на 20 ГБ не запускается на карте с 24 ГБ? Потому что кроме весов в память ложатся KV-кэш и служебные буферы. Реальный расход равен весам плюс кэш под ваш контекст плюс примерно гигабайт оверхеда. Уменьшите контекст или возьмите квант поменьше.
Q4 сильно портит качество? Q4_K_M считается рабочим компромиссом: около 0,56 байта на параметр против 2 в FP16 при потерях, которые в обычных задачах заметить трудно. Если памяти хватает с запасом, Q5 или Q6 дадут чуть более аккуратные ответы, но разница меньше, чем между моделями разных поколений.
Что лучше: плотная 14B или MoE на 30B? При равном объёме памяти MoE обычно выигрывает, потому что активирует лишь часть весов и работает быстрее при большем общем размере. Проверьте только, влезает ли она целиком: в памяти нужно держать всех экспертов, а не активных.
Считается ли объединённая память видеопамятью? Функционально да, модель грузится в неё целиком. Но пропускная способность у неё в разы ниже, чем у GDDR7, и генерация идёт медленнее при том же объёме.
Можно ли объединить две видеокарты и сложить память? Для инференса — да, llama.cpp и vLLM умеют разносить слои по нескольким GPU. Суммарный объём складывается, скорость упирается в обмен по PCIe. Для домашней сборки вариант рабочий, но заметно более хлопотный, чем одна карта с нужным объёмом.
Что дальше
Посчитайте память под конкретную модель, которую собираетесь запускать, а не «вообще». Возьмите вес файла с Hugging Face, прибавьте KV-кэш по формуле выше под нужную длину контекста, добавьте гигабайт сверху. Полученное число и есть ваш минимум по видеопамяти — всё остальное в спецификациях вторично.
Если конфигурация ещё не собрана, начните с гайда по запуску нейросети на своей видеокарте, а разобраться, стоит ли овчинка выделки, поможет разбор зачем нужны локальные модели. Готовые варианты по объёму памяти — в каталоге: Palit RTX 5060 Ti 16 ГБ как точка входа, MSI RTX 5070 Ti 16 ГБ когда важна скорость, NVIDIA DGX Spark 128 ГБ для моделей, которые в видеокарту не помещаются в принципе.
RTXSpark — независимый информационный портал, не связанный с NVIDIA, AMD и Apple. Названия продуктов используются только для обозначения самих продуктов. Характеристики неанонсированных устройств приведены по открытым утечкам и официального подтверждения не имеют.