Независимый портал · не связан с NVIDIA

Установка ComfyUI и FLUX: от скачивания до первой картинки

1 августа 2026 г.
Видеокарта на рабочем столе: сборка для установки ComfyUI и FLUX

Чтобы генерировать картинки локально через FLUX, нужны портативная сборка ComfyUI, четыре файла моделей общим весом почти 18 ГБ и видеокарта NVIDIA. Работает и на 8 ГБ видеопамяти: модель просто не влезает в неё целиком и подкачивается из оперативной, за это вы платите минутами ожидания. Ниже — установка с нуля, разбор каждой ноды рабочего графа и настройки, которые реально меняют картинку.

Что понадобится: железо, место на диске и терпение

FLUX.1-dev — модель на 12 миллиардов параметров. В версии fp8 её веса занимают 11,9 ГБ, и это главная цифра, вокруг которой крутится всё остальное.

Что Минимум Комфортно
Видеокарта NVIDIA с 8 ГБ VRAM 16 ГБ и больше
Оперативная память 16 ГБ 32 ГБ
Место на SSD 30 ГБ 60 ГБ, если планируете LoRA и ControlNet
Windows 10 или 11, 64 бит

С видеопамятью есть момент, который в большинстве гайдов проскакивают. Если у вас 8 ГБ, модель на 11,9 ГБ в них не помещается физически. ComfyUI не падает: он грузит блоки трансформера в видеопамять порциями, а остальное держит в оперативной и гоняет через шину PCIe. Картинка получается визуально та же, что на топовой карте с тем же сидом, разница только во времени. Отсюда требование к оперативке: 16 ГБ — нижняя граница, на 32 ГБ система перестаёт упираться в своп.

Гайд написан и проверен на связке RTX 3050 с 8 ГБ видеопамяти и 32 ГБ оперативной, ComfyUI 0.29.2, встроенный Python 3.13, PyTorch 2.13 с CUDA 13. Это сознательно слабая конфигурация: если работает здесь, на вашей заработает тем более.

Видеокарта с 8 ГБ видеопамяти в корпусе ПК для локальной генерации через FLUX

AMD и Intel Arc формально поддерживаются, но через ROCm и OpenVINO, со своими граблями и заметно медленнее. Если карта ещё не куплена и локальная генерация — одна из задач, смотрите в сторону 16 ГБ: этого объёма хватает и на FLUX без компромиссов, и на языковые модели среднего размера. Мы разбирали этот выбор подробно в материале про видеопамять для локальных LLM, а готовые варианты собраны в каталоге видеокарт.

Шаг 1. Скачайте портативную сборку ComfyUI для Windows

Портативная сборка — это архив, внутри которого лежит и сам ComfyUI, и своя изолированная сборка Python со всеми зависимостями. Ничего не ставится в систему, ничего не конфликтует с уже установленным Python, а удаляется всё удалением папки. Для первого знакомства это лучший вариант.

Идите на страницу релизов ComfyUI и качайте файл ComfyUI_windows_portable_nvidia.7z — около 3 ГБ. Прямая ссылка на свежую версию: ComfyUI_windows_portable_nvidia.7z.

Распаковывать нужно 7-Zip: встроенный распаковщик Windows на таких архивах либо ругается, либо распаковывает часами. Путь выберите короткий и без кириллицы: D:\ComfyUI подойдёт, а папка внутри «Загрузок» с русским именем пользователя — источник будущих проблем с путями к моделям.

В архиве два стартовых файла. Запускайте run_nvidia_gpu.bat. Второй, run_cpu.bat, существует для машин без видеокарты NVIDIA, и FLUX на процессоре считается десятки минут — упоминаю только чтобы вы не перепутали.

Шаг 2. Первый запуск: убедитесь, что видеокарту видно

Запустите run_nvidia_gpu.bat. Откроется консоль, побегут строки загрузки, затем браузер сам откроет интерфейс по адресу http://127.0.0.1:8188.

Консоль закрывать нельзя — это и есть сервер. Браузер тут только рисует интерфейс, вся работа идёт в консольном окне.

В первых строках лога найдите блок про устройство. Должно быть примерно так:

Total VRAM 8188 MB, total RAM 32605 MB
Device: cuda:0 NVIDIA GeForce RTX 3050 : cudaMallocAsync

Если вместо cuda:0 написано cpu — драйвер NVIDIA не подхватился. Обновите драйвер с сайта NVIDIA и перезапустите. Это самая частая причина, по которой «всё установилось, но генерация идёт двадцать минут».

Сейчас в интерфейсе уже открыт какой-нибудь шаблонный граф, но моделей нет, и запускать его бессмысленно. Закрывайте консоль, идём за весами.

Шаг 3. Скачайте четыре файла моделей

Здесь новички спотыкаются чаще всего. FLUX не сводится к одному файлу, как привычные чекпойнты Stable Diffusion. Это четыре отдельных компонента, и каждый ложится в свою папку. Перепутаете папку — нода просто не увидит файл в выпадающем списке.

Файл Размер Куда класть Откуда
flux1-dev-fp8.safetensors 11,9 ГБ models\diffusion_models\ Kijai/flux-fp8
t5xxl_fp8_e4m3fn_scaled.safetensors 5,16 ГБ models\text_encoders\ comfyanonymous/flux_text_encoders
clip_l.safetensors 246 МБ models\text_encoders\ там же
ae.safetensors 335 МБ models\vae\ black-forest-labs/FLUX.1-dev

Разница между ними не только в размере.

  • flux1-dev-fp8 — сама диффузионная модель, она и рисует.
  • t5xxl — большой текстовый энкодер. Из-за него FLUX читает промпт как предложение, а не как набор тегов, и это главное отличие от Stable Diffusion.
  • clip_l — второй энкодер, поменьше, работает с первым в паре.
  • ae.safetensors переводит результат из латентного пространства в обычные пиксели.

Два сюрприза ждут прямо на этом шаге.

За ae.safetensors придётся зайти на Hugging Face под своим аккаунтом и принять лицензию — репозиторий закрытый. Без этого файл не отдастся.

FLUX.1-dev распространяется по некоммерческой лицензии, и тут легко перепутать, на что именно она распространяется. Ограничена сама модель: поднять на её весах платный сервис генерации или встроить их в коммерческий продукт без отдельной лицензии от Black Forest Labs нельзя. А сами картинки лицензия разрешает использовать в любых целях, включая коммерческие, это прямо оговорено в разделе 2(d). Единственный запрет на результат генерации: обучать на нём модель, конкурирующую с FLUX. Ограничение на веса работает и тогда, когда вы качаете fp8-версию из стороннего репозитория: переупаковка исходную лицензию не отменяет. Если коммерческого использования требует именно модель, смотрите на FLUX.1-schnell под Apache 2.0. Он быстрее (4 шага вместо 30) и заметно слабее в детализации.

Скачивание всего комплекта — это 17,6 ГБ. Кладите файлы сразу в правильные папки внутри ComfyUI\models\, чтобы не перекладывать потом гигабайты.

Шаг 4. Соберите граф: разбор каждой ноды

Запускайте ComfyUI снова. Граф можно собрать руками, а можно взять шаблон из меню, но понимать, что делает каждая нода, всё равно придётся — иначе любая ошибка превращается в гадание.

Вот рабочий граф, на котором сделаны все иллюстрации к этой статье:

Рабочий граф ComfyUI для FLUX: загрузчики модели, CLIP и VAE, ноды KSampler и FluxGuidance

Данные идут слева направо: загрузчики отдают модель и текст, сэмплер считает латент, VAE превращает его в картинку.

Загрузить модель диффузии (UNETLoader)

Выбираете flux1-dev-fp8.safetensors, тип весов — fp8_e4m3fn. Тип весов важен: если оставить default, ComfyUI попытается развернуть модель в fp16, она распухнет вдвое и на восьмигиговой карте всё встанет колом.

Двойной загрузчик CLIP (DualCLIPLoader)

Здесь два поля: clip_l.safetensors и t5xxl_fp8_e4m3fn_scaled.safetensors. Тип обязательно flux. Порядок полей роли не играет, ComfyUI разберётся сам.

Кодирование текста CLIP (CLIPTextEncode)

Их две штуки. В верхнюю вы пишете свой промпт. Нижняя формально считается негативным промптом, и вот про неё главное: при cfg 1 негативный промпт не работает вообще. Можете написать туда blurry, low quality, distorted или оставить пустым, на результат это не повлияет никак. Механизм classifier-free guidance, который сравнивает положительное и отрицательное условия, при cfg равном единице выключен. Люди месяцами пишут туда заклинания и удивляются, почему не помогает.

Выборка модели Flux (ModelSamplingFlux)

Параметры max_shift 1.15 и base_shift 0.5 — значения по умолчанию, трогать их без причины не надо. А вот ширину и высоту здесь нужно держать теми же, что в латенте: нода считает сдвиг расписания шума от размеров кадра, и рассогласование ломает композицию.

Пустой SD3LatentImage

Размер будущей картинки. FLUX обучался примерно на одном мегапикселе, и это не рекомендация, а рабочий диапазон: 1024×1024, 1216×832, 1376×720. На меньшем кадре теряются мелкие детали, на заметно большем модель начинает строить другую композицию и мылить.

Направление Flux (FluxGuidance)

По умолчанию здесь 3.5, и это хорошая отправная точка. Ниже 2 картинка становится вольной и слабо связанной с промптом, выше 5 — контрастной и пережаренной. Это не то же самое, что cfg, хотя путают их постоянно.

KSampler

Здесь три критичных поля. cfg строго 1 — для FLUX это не настройка, а требование архитектуры. steps 30: на 20 шагах картинка заметно мягче, разницу видно на одном и том же сиде. Из семплеров берите euler со scheduler в положении simple, это рабочая пара для FLUX.

Загрузить VAE и Декодировать VAE

Выбираете ae.safetensors, дальше нода превращает латент в изображение.

Сохранить изображение

Готовые файлы падают в ComfyUI\output\.

Шаг 5. Первая генерация и сколько она идёт

Впишите в верхнюю ноду промпт на английском и нажмите кнопку запуска.

Первый запуск всегда долгий: ComfyUI читает с диска 17,6 ГБ весов. Дальше модель остаётся в памяти, и повторные генерации идут быстрее — при условии, что вы не меняете размер кадра и не трогаете загрузчики, иначе часть модели перезагружается.

Иллюстрации к этой статье считались на той самой MSI RTX 3050 8 ГБ: кадр 1216×832 на 30 шагах занял 178 и 179 секунд, широкий кадр 1376×720 под обложку — 176 секунд. То есть около трёх минут на картинку, и разброс между запусками почти нулевой. Половину этого времени карта не считает, а ждёт: блоки модели ездят между оперативной и видеопамятью. На карте, куда FLUX помещается целиком, те же 30 шагов проходят заметно быстрее.

Пока идёт счёт, в консоли видно прогресс по шагам — это удобнее, чем смотреть на индикатор в браузере.

FLUX на 8 ГБ видеопамяти: что делать, если не хватает

Самый честный способ ускориться на слабой карте — взять модель поменьше. GGUF-кванты FLUX работают через дополнительную ноду ComfyUI-GGUF, а сами файлы лежат в city96/FLUX.1-dev-gguf.

Квант Размер Смысл
Q8_0 12,7 ГБ Практически неотличим от fp8, но и не легче
Q6_K 9,86 ГБ Разумный компромисс для 12 ГБ
Q4_K_S 6,81 ГБ Влезает в 8 ГБ целиком — вот ради этого всё и затевается
Q2_K 4,03 ГБ Работает, но качество проседает заметно

Q4_K_S на восьмигиговой карте помещается в видеопамять полностью, и подкачка через PCIe прекращается. Детализация немного падает, зато карта перестаёт ждать данные, а на это ожидание в fp8 уходит заметная часть времени. Если генерировать нужно много и подряд, размен выгодный.

Второй приём — не трогать текстовый энкодер лишний раз. Пока промпт не меняется, ComfyUI не перекодирует его заново, и t5xxl не занимает память во время сэмплирования.

И ключ --lowvram в строке запуска: он заставляет ComfyUI агрессивнее выгружать блоки. На 8 ГБ иногда спасает от ошибки нехватки памяти, но замедляет генерацию.

Как писать промпты для FLUX

FLUX ломает привычку, выработанную на Stable Diffusion. Гирлянда тегов через запятую вида mini pc, desk, keyboard, 8k, masterpiece, best quality здесь работает плохо. Благодаря энкодеру T5 модель читает промпт как связный текст, поэтому описывайте сцену предложением: a compact mini PC on a wooden desk next to a mechanical keyboard, morning light from a window.

Веса в скобках (слово:1.3) и параметры чужих генераторов (--ar, --v) FLUX не понимает и втягивает их в промпт как обычный текст.

Кириллицу модель рисует нечитаемым набором закорючек. Латиницу — уверенно, и в этом ловушка. Иллюстрацию к этому разделу пришлось генерировать дважды: в первый раз FLUX сам, без всякой просьбы, написал на корпусе мини-ПК несуществующее слово «DIONHERT». Запрет no text, no logos в промпте его не остановил. Смотрите на готовый кадр внимательно, прежде чем ставить его в статью.

Просьба нарисовать конкретное устройство почти гарантированно даёт чужой логотип: попросите мини-ПК «как настоящий» — получите узнаваемый корпус с яблоком на крышке. Публиковать такое нельзя, поэтому в промптах для сайта мы пишем generic unbranded compact AI workstation.

Тёмный кинематографичный свет оказывается ловушкой. Слова cinematic, dark studio, atmospheric haze уводят кадр в дымку, где почти нет деталей. Заметно это не сразу: на глаз картинка «атмосферная», а весит после сжатия 15–25 КБ вместо нормальных 50–150 КБ на кадр 1200×630. Вес файла — самый дешёвый индикатор того, что в кадре пусто.

Пример генерации FLUX: детализация при ровном предметном свете

Автоматизация: генерация через API

Кликать по интерфейсу нормально, пока картинок пять. Когда их полсотни и все по шаблону, ComfyUI умеет работать как обычный HTTP-сервис — тот же порт 8188, только без браузера.

Сначала выгрузите граф в машинном формате: Workflow → Export (API). Это не тот же файл, что обычное сохранение. В API-формате граф выглядит как плоский JSON, где ключи — номера нод, а связи заданы ссылками ["6", 0]:

{
  "7": {
    "inputs": {
      "seed": 398603919673852,
      "steps": 30,
      "cfg": 1,
      "sampler_name": "euler",
      "scheduler": "simple",
      "model": ["6", 0],
      "positive": ["11", 0]
    },
    "class_type": "KSampler"
  }
}

Дальше цикл простой. Подменяете в JSON нужные поля — текст промпта в ноде CLIPTextEncode, размеры в латенте, сид в KSampler. Отправляете POST на /prompt с телом {"prompt": граф, "client_id": "любая-строка"} и получаете prompt_id. Опрашиваете GET /history/<prompt_id>, пока в ответе не появится блок outputs с именем файла. Забираете картинку через GET /view?filename=...&subfolder=...&type=output.

Пара граблей, за которые заплачено временем.

Сид меняйте сами на каждый запуск. Режим randomize в интерфейсе — свойство браузерного клиента, а не сервера: через API вы будете получать один и тот же кадр, пока не подставите новое число.

Размер кадра нужно менять синхронно в двух местах — в латенте и в ModelSamplingFlux. Поправите только латент, получите поехавшую композицию и долго будете думать почему.

Проверить, жив ли сервер, можно запросом GET /system_stats — он же показывает, сколько видеопамяти свободно.

У нас на RTXSpark на этом API собран скрипт, который принимает промпт и имя файла, ждёт результат, конвертирует в WebP и кладёт в папку сайта. Обложка и иллюстрации к этой статье сделаны им же.

Частые ошибки

Модель не появляется в выпадающем списке ноды. Файл лежит не в той папке или ComfyUI был запущен до того, как вы его положили. Нажмите обновление интерфейса в браузере (R), а если не помогло — перезапустите сервер.

Error: Sizes of tensors must match. Почти всегда это тип весов default вместо fp8_e4m3fn в UNETLoader либо тип не flux в DualCLIPLoader.

CUDA out of memory. Закройте браузерные вкладки и игры, они тоже едят видеопамять. Уменьшите кадр до 1024×1024. Если повторяется — переходите на GGUF-квант Q4_K_S.

Картинка вышла мутной и однотонной. Проверьте cfg: он должен быть ровно 1. При cfg 7, как в Stable Diffusion, FLUX выдаёт пережжённый мусор.

Генерация идёт, но результат чёрный. Не выбран или выбран не тот VAE. Нужен именно ae.safetensors.

Частые вопросы

Пойдёт ли FLUX на 6 ГБ видеопамяти? Формально да, через GGUF-квант Q4_K_S или Q3_K_S, но с постоянной подкачкой и долгим ожиданием. На 6 ГБ я бы смотрел в сторону SDXL: он заметно легче и на такой карте живёт комфортно.

Нужен ли интернет после установки? Нет. Скачали модели — дальше всё считается локально и офлайн. В этом же смысл затеи, что и у локального запуска языковых моделей.

Чем dev отличается от schnell? Dev качественнее и требует около 30 шагов, лицензия некоммерческая. Schnell рисует за 4 шага, отдан под Apache 2.0 и годится для коммерции, но проигрывает в детализации и сложных сценах.

Можно ли ставить рядом с уже установленным Stable Diffusion? Да. Портативная сборка ни с чем не пересекается, а модели можно не дублировать: пропишите пути к общей папке в файле extra_model_paths.yaml.

Сколько всего займёт место? Сама сборка занимает около 6 ГБ после распаковки, модели FLUX — 17,6 ГБ. Закладывайте 30 ГБ, и это без LoRA и ControlNet.

Обязательно ли принимать лицензию на Hugging Face? Для ae.safetensors из репозитория black-forest-labs — да, он закрытый. Остальные три файла качаются свободно.

Что дальше

Рабочий ComfyUI — половина дела: дальше идут LoRA под свой стиль, ControlNet для контроля композиции и апскейлеры. Но прежде чем тащить в граф чужие ноды, прогоните один и тот же промпт на 20 и 30 шагах с одним сидом. Десять минут работы, зато сразу видно, за что вы платите временем.

Если параллельно хотите запустить локально ещё и языковую модель, у нас есть отдельный гайд по запуску нейросети на своей видеокарте — там про Ollama и подбор модели под объём памяти. А если стало понятно, что 8 ГБ тесновато, посмотрите Palit RTX 5060 Ti на 16 ГБ: на момент публикации это самая доступная карта в каталоге RTXSpark с объёмом, в который FLUX помещается целиком.

Проект RTXSpark не связан с NVIDIA, Black Forest Labs и Comfy Org. Названия продуктов используются только для обозначения самих продуктов.