Независимый портал · не связан с NVIDIA

Какие LLM потянет RTX Spark: модели до 120B на практике

24 июля 2026 г.
Компактная AI-станция для локального запуска LLM до 120B параметров

RTX Spark — так чаще всего ищут настольную станцию NVIDIA DGX Spark — со 128 ГБ объединённой памяти запускает модели вплоть до 120 миллиардов параметров. Влезает почти всё, вопрос только в скорости. MoE-модель gpt-oss-120b выдаёт 33–53 токена в секунду, плотная Llama 3.1 70B — 2,7. Модель почти вдвое крупнее работает на порядок быстрее.

RTXSpark — независимый портал, с NVIDIA не связан. Характеристики устройства даны по официальной странице продукта, скорости — по открытым бенчмаркам, каждый со ссылкой.

Какие LLM тянет RTX Spark: короткий ответ

Класс модели Пример Влезает в 128 ГБ Как идёт на практике
MoE до 120B gpt-oss-120b Да, с запасом 33–53 ток/с — рабочий темп
MoE 20–30B gpt-oss-20b, Qwen3-30B-A3B Да, свободно 60–90 ток/с, быстрее чтения
Плотные до 8B Qwen3 8B Да 40–45 ток/с, комфортно
Плотные 30B+ Qwen3 32B Да 10,7 ток/с — терпимо, но вязко
Плотные 70B+ Llama 3.1 70B Да 2,7 ток/с — только под пакетную обработку

Ни одна строчка в этой таблице не упирается в объём памяти. Упирается всё в архитектуру: идёт текст потоком или капает по букве, определяет число активных параметров.

128 ГБ памяти — это не 128 ГБ VRAM

Здесь чаще всего и путаются. В спецификации стоит 128 ГБ, и рядом обычные видеокарты с их 16–32 ГБ выглядят несерьёзно. Но память Spark — унифицированная LPDDR5x, общая для 20-ядерного Arm-процессора и Blackwell-графики, с пропускной способностью 273 ГБ/с (NVIDIA).

Сравните с RTX 5090: памяти вчетверо меньше, зато 1792 ГБ/с — по пропускной способности разрыв в шесть с половиной раз. Он и объясняет весь характер устройства.

Генерация токена упирается именно в пропускную способность. Чтобы выдать один токен, движок обязан прогнать через шину все активные веса модели. Отсюда грубая прикидка потолка:

токенов в секунду ≈ пропускная способность ÷ объём активных весов

Плата компактной AI-станции с объединённой памятью LPDDR5x для запуска локальных LLM

Проверим на реальных замерах. Qwen3 32B в Q4_K_M весит около 18 ГБ: 273 ÷ 18 = 15 ток/с в теории, на прогоне вышло 10,7. Llama 3.1 70B в FP8 — это примерно 70 ГБ: теория даёт 3,9, практика 2,7. Qwen3 8B в Q4_K_M занимает 4,6 ГБ: теория 59, практика 43,7. Во всех трёх случаях реальность держится на уровне 70–73% от расчёта, и этой погрешности хватает, чтобы прикинуть скорость плотной модели ещё до покупки. С MoE так просто не выйдет, но об этом ниже, в разделе про подбор модели.

На входе картина обратная. Обработка промпта нагружает тензорные ядра, шина при этом почти простаивает, и цифры сразу другие: 1689 токенов в секунду для gpt-oss-120b (jetsonhacks), почти 8000 для Llama 3.1 8B (LMSYS). Кинуть в модель стостраничный документ она успевает за секунды. А потом начинает медленно отвечать.

Если хотите разобраться в расчёте памяти под конкретную модель, у нас есть отдельный разбор: сколько видеопамяти нужно для локальных LLM.

Почему 120B обгоняет 70B

Всё упирается в архитектуру модели.

gpt-oss-120b — это Mixture-of-Experts. Формально 117 миллиардов параметров, но на каждый токен активны только 5,1 миллиарда: модель держит 128 «экспертов» и включает четыре из них на шаг (модель-карта, arXiv). Плюс родное квантование MXFP4, примерно 4,25 бита на вес. Итог: через узкую шину на каждый токен прокачиваются веса пяти миллиардов параметров, а не ста двадцати.

Llama 70B — плотная. Никаких экспертов, на каждый токен работают все семьдесят миллиардов весов. Чтобы выдавать текст с читаемой скоростью, память обязана прокачивать эти десятки гигабайт десятки раз в секунду. При 273 ГБ/с математика беспощадна.

Правило для Spark простое: смотрите на число активных параметров, общее вам ни о чём не скажет. MoE для этого железа родная стихия, плотные тяжеловесы — его слабое место, и разрыв между ними измеряется разами.

Скорость по моделям: цифры с прогонов

Собрал в одну таблицу то, что дают открытые бенчмарки. Замеры сделаны на llama.cpp при минимальной глубине контекста — кроме строки Llama 3.1 70B, она снята на SGLang с контекстом 2048.

Модель Активных параметров Квант Генерация, ток/с
gpt-oss-20b 3,6B из 21B (MoE) MXFP4 79,7
Qwen3-30B-A3B Coder 3,3B из 30B (MoE) Q8_0 60,0
gpt-oss-120b 5,1B из 117B (MoE) MXFP4 52,9
Qwen3 8B 8B (плотная) Q4_K_M 43,7
Qwen2.5 Coder 7B 7,6B (плотная) Q8_0 29,4
GLM-4.5 Air 12B из 106B (MoE) Q4_K 22,6
Qwen3 32B 32,8B (плотная) Q4_K_M 10,7
Llama 3.1 70B 70B (плотная) FP8 2,7

Источники: jetsonhacks — gpt-oss, Qwen3 Coder, Qwen2.5 Coder, GLM-4.5 Air; llama.cpp_bench — Qwen3 8B и 32B; LMSYS — Llama 3.1 70B.

Отсортируйте эту таблицу мысленно по колонке «активных параметров» — она встанет почти по убыванию скорости. Два исключения объясняются квантованием: Qwen3-30B-A3B и Qwen2.5 Coder 7B замерялись в Q8_0, где на каждый параметр приходится вдвое больше байт, чем в четырёхбитных форматах, и через шину идёт вдвое больше данных. Общий размер модели с порядком строк не коррелирует вообще: GLM-4.5 Air на 106 миллиардов параметров обгоняет Qwen3 на 32 миллиарда вдвое.

По самой обсуждаемой модели, gpt-oss-120b, разброс цифр стоит пояснить отдельно: в обзорах встречаются все варианты сразу, и они друг другу противоречат. Железо у всех одно, различается методика замера:

  • 33,5 ток/с — одиночный поток под нагрузкой, ближе всего к тому, что вы увидите в работе (Dendro Logic);
  • около 35 ток/с — llama.cpp на прогоне с генерацией в 32 токена (discussion #16578);
  • до 50 ток/с — SGLang после оптимизации (LMSYS);
  • 52,9 ток/с — llama.cpp при полностью пустом контексте, синтетический максимум (jetsonhacks).

Коридор 33–53 — вот честный ответ, где нижняя граница описывает рабочий день, а верхняя снята в тепличных условиях.

Отдельно про обёртки, через которые модель запускают чаще всего. Ollama и LM Studio построены на том же llama.cpp, но за удобство берут плату: gpt-oss-20b на Ollama выдал 49,7 ток/с (LMSYS) против 79,7 в синтетическом прогоне голого llama.cpp. Треть скорости уходит на прослойку, и это стоит держать в голове, когда сравниваете свои цифры с обзорами.

Даже нижняя граница быстрее, чем читает человек, так что заявленная способность крутить 120B локально не преувеличение. Я бы только не ждал от коробки отзывчивости облачного API: одному пользователю за своим столом хватает, отделу — нет.

Плотные модели: где Spark спотыкается

Не буду сглаживать. Для плотных моделей от 30B и выше одиночным потоком Spark — так себе выбор.

Qwen3 32B выдаёт 10,7 токена в секунду. Это скорость медленного человеческого набора: читать успеваешь, но окончания абзаца приходится ждать. Терпимо для разовых запросов, утомительно для диалога.

Llama 3.1 70B в FP8 — 2,7 токена в секунду. Фраза набирается медленнее, чем вы её читаете. Для живого чата непригодно, и никакие настройки бэкенда этого не спасут: упирается в физику шины.

В обзорах обычно теряется ещё одна деталь: маленькие плотные модели тут тоже не блещут. Qwen2.5 Coder 7B в Q8 идёт со скоростью 29,4 ток/с, а MoE на 30 миллиардов параметров выдаёт 60. Семимиллиардная модель вдвое медленнее тридцатимиллиардной. Если вы привыкли к логике «меньше модель — быстрее ответ», на Spark её придётся забыть.

Единственная плотная категория, где всё нормально, — до 8–9 миллиардов параметров в четырёх битах. Там 40–45 ток/с, и жаловаться не на что.

Длинный контекст съедает скорость

Все цифры выше сняты при почти пустом контексте. В реальной работе контекст растёт, а вместе с ним растёт объём, который память обязана перечитывать на каждом шаге.

Для gpt-oss-120b это выглядит так: при пустом контексте около 35 ток/с на генерации и порядка 1700 на обработке промпта, при 32 тысячах токенов в контексте — примерно 24 и 1000 соответственно (discussion #16578). Треть скорости уходит.

Отсюда правило для кодового агента, который таскает за собой половину репозитория: закладывайте две трети от паспортной цифры из обзора. И держите контекст в разумных рамках вместо «на всякий случай максимального».

Второе дно: пакетная обработка

Одиночный декодинг — худшая метрика Spark, и показывают в обзорах именно её. А стоит подать на вход много запросов сразу, и та же коробка ведёт себя совершенно иначе.

Nemotron Super 49B в NVFP4 одиночным потоком даёт 5,79 токена в секунду. При 256 параллельных запросах суммарная пропускная способность — 695 ток/с (Dendro Logic). У gpt-oss-120b тот же эффект: 33,5 в одиночку и 863 при 256 потоках. Llama 3.1 8B на SGLang разгоняется с 20,5 ток/с при батче 1 до 368 при батче 32 (LMSYS).

Механика простая: при батчинге веса читаются из памяти один раз на весь батч, а не заново на каждый запрос.

Так что на пакетных задачах Spark раскрывается совсем иначе: прогнать тысячу документов за ночь, разметить датасет, собрать эмбеддинги. Масштабируется, правда, не всё. Nemotron Nano 9B в том же тесте упёрся в потолок около 156 ток/с и дальше на рост параллелизма не отвечал. Но если пакетные задачи — это про вас, именно под них устройство и стоит смотреть: конфигурации и цены собраны в карточке NVIDIA DGX Spark 128 ГБ.

Где предел и когда брать другое

NVIDIA заявляет инференс моделей до 200 миллиардов параметров на одном устройстве и до 405 миллиардов на двух Spark, связанных через ConnectX-7 на 200 Гбит/с (NVIDIA). Технически это правда: память позволяет. Меня эта строчка в спецификации всё же немного раздражает — придраться не к чему, а картинку в голове она рисует ту, которой не будет.

Две компактные AI-станции, связанные сетевым кабелем в связку для запуска моделей до 405B

Только помните про шину. Плотная модель на 200B даже в четырёх битах — это сотня гигабайт весов, которые придётся прокачивать на каждый токен. По формуле выше получается около двух токенов в секунду. Запустится, но смотреть на такую выдачу можно только из спортивного интереса. У связки из двух коробок ситуация не лучше: память каждого узла всё та же, а между узлами добавляется сеть.

Когда Spark не ваш вариант:

  • нужен быстрый интерактив на плотных моделях от 30B — тут выигрывает дискретная карта с быстрой памятью или облако;
  • задача про максимальный tok/s одному пользователю — GDDR7 и HBM обгоняют с большим отрывом;
  • модели меняются каждую неделю и вы гоняете что попало, не глядя на архитектуру, — половина запусков разочарует.

Когда Spark на своём месте: приватность и локальность важнее пиковой скорости, модели выбираются осознанно в пользу MoE, есть пакетные задачи, нужен стенд для дообучения и прототипирования под дальнейший деплой в дата-центр. Если в приоритете сам подход с объединённой памятью, сравните заодно с альтернативой — RTX Spark против Apple Silicon.

Само устройство и предложения магазинов — в карточке NVIDIA DGX Spark 128 ГБ. Из партнёрских версий с той же памятью и той же пропускной способностью есть ASUS Ascent GX10, остальные варианты собраны в разделе AI-станции.

Как подобрать модель под RTX Spark

Порядок действий, который экономит вечер:

  1. Возьмите на Hugging Face вес файла модели в нужном кванте — это и есть объём в памяти.
  2. Найдите число активных параметров. У MoE оно вынесено в название (A3B у Qwen3-30B-A3B) или лежит в карточке модели.
  3. Посчитайте объём активных весов: активные параметры × байт на параметр (примерно 0,56 для Q4_K_M, 0,53 для MXFP4, 1,0 для FP8).
  4. Разделите 273 на полученное число — это теоретический потолок.
  5. Умножьте на поправку. Для плотной модели берите 0,7, для MoE — 0,5.

Про поправку нужна оговорка, иначе расчёт вас обманет. На плотных моделях она работает надёжно: доля от теоретического потолка составила 0,73 у Qwen3 8B, 0,73 у Ministral 8B и 14B, 0,72 у Qwen3 32B и 0,70 у Llama 70B — пять независимых замеров в узком коридоре. У MoE разброс втрое шире: 0,60 у Qwen3-30B-A3B, 0,56 у gpt-oss-20b, 0,55 у GLM-4.5 Air и всего 0,33–0,52 у gpt-oss-120b, где сказываются роутер и общие слои внимания. Так что для MoE считайте результат оценкой сверху и сверяйтесь с реальными замерами: их по популярным моделям уже достаточно.

Получилось меньше 15 токенов в секунду — ищите MoE-аналог сопоставимого качества. За последний год открытых MoE вышло столько, что вариант с малым числом активных весов находится почти под любую задачу.

Частые вопросы

Какую самую большую модель реально запустить на DGX Spark?
По памяти влезают модели вплоть до 200 миллиардов параметров в четырёхбитном квантовании — таков официально заявленный предел. Но «влезает» и «удобно работает» — разное. Комфортный потолок для интерактива — MoE уровня gpt-oss-120b, где активны лишь 5,1B весов.

Сколько токенов в секунду выдаёт gpt-oss-120b?
От 33 до 53 в зависимости от бэкенда, глубины контекста и настроек. Коробочный llama.cpp даёт около 35 на реальных прогонах, оптимизированный SGLang — до 50. Для локального ассистента и кодового агента этого достаточно.

Почему Llama 70B работает медленнее, чем gpt-oss-120b?
Llama 70B плотная: на каждый токен задействованы все веса. gpt-oss-120b — MoE, активны 5,1B из 117B. При ограниченной пропускной способности памяти решает число активных параметров, а не общее.

Насколько Spark хорош на обработке промпта?
Заметно лучше, чем на генерации: около 8000 токенов в секунду на Llama 3.1 8B и 1689 на gpt-oss-120b. Загрузить длинный документ и получить по нему ответ — сценарий, в котором коробка выглядит достойно. Провал начинается дальше, на выдаче текста.

Хватит ли 128 ГБ для дообучения?
Для файнтюна средних моделей и LoRA-адаптеров памяти хватает, устройство под такие задачи и позиционируется. Полное обучение крупных моделей — не сюда, там нужен кластер.

Можно ли объединить два Spark?
Да, через встроенный ConnectX-7 на 200 Гбит/с два устройства связываются под модели до 405 миллиардов параметров. Скорость генерации на плотных моделях всё равно упрётся в память каждого узла: объём вырастет, отзывчивость нет.

Что выбрать под Spark: четырёхбитный квант или восьмибитный?
Четырёхбитный, почти всегда. На этом железе байты на параметр напрямую конвертируются в токены в секунду: Qwen2.5 Coder 7B в Q8 даёт 29,4 ток/с, а сопоставимый по размеру Qwen3 8B в Q4_K_M — 43,7. Разница в качестве ответов между Q4_K_M и Q8 меньше, чем разница в скорости.

Что дальше

Прежде чем присматриваться к устройству, составьте список моделей, на которых вы реально работаете, и посчитайте по формуле выше ожидаемую скорость каждой. Если в списке одни плотные модели за 30B, Spark разочарует независимо от объёма памяти. Если там MoE и пакетные задачи — цифры сойдутся.

Разобраться, зачем вообще держать модели у себя, поможет разбор для чего нужны локальные модели, а посчитать память под конкретную модель — расчёт видеопамяти под LLM с формулой KV-кэша. Устройства с объединённой памятью в каталоге: NVIDIA DGX Spark 128 ГБ и ASUS Ascent GX10.

RTXSpark — независимый информационный портал, не связанный с NVIDIA. Названия продуктов используются только для обозначения самих продуктов. Приведённые скорости получены сторонними командами на открытых бенчмарках и зависят от бэкенда, версии драйверов и настроек запуска.