سبد خرید
0

سبد خرید شما خالی است.

حساب کاربری

41139021

با ما در تماس باشید

استفاده از دو کارت گرافیک در ComfyUI؛ بررسی RTX 5090 و RTX 4090

ComfyUI
زمان مطالعه : 38 دقیقهنویسنده :
تاریخ انتشار : 9 شهریور 1405

فهرست مطالب این صفحه

لایک0

اشتراک

وقتی صحبت از اجرای مدل‌های سنگینی مثل Wan 2.2، LTX-2.3، Hunyuan Video، FLUX یا SDXL در ComfyUI می‌شود، اولین راهکاری که به ذهن می‌رسد اضافه‌کردن کارت گرافیک دوم و استفاده از دو کارت گرافیک در ComfyUI است. تصور اولیه هم ساده است: اگر یک RTX 5090 سریع است، دو RTX 5090 باید دو برابر سریع‌تر باشند و 64GB حافظه گرافیکی در اختیارمان قرار دهند.

اما در عمل، Multi-GPU در ComfyUI به این سادگی کار نمی‌کند.

گاهی کارت دوم می‌تواند زمان Sampling را تقریباً نصف کند، گاهی فقط اجازه می‌دهد دو خروجی را هم‌زمان بگیریم و در بعضی Workflowها نیز هیچ افزایش سرعت محسوسی ایجاد نمی‌کند. حتی ممکن است دو GPU در Task Manager دیده شوند، اما بخش اصلی پردازش همچنان فقط روی یکی از آن‌ها انجام شود.

در این مقاله بررسی می‌کنیم که استفاده از دو RTX 4090، دو RTX 5090 یا ترکیب RTX 5090 و RTX 4090 در ComfyUI دقیقاً چه نتیجه‌ای دارد، چه مدل‌هایی از Multi-GPU استفاده می‌کنند و چه زمانی خرید کارت دوم تصمیم منطقی‌تری از ارتقا به یک GPU قوی‌تر است.

استفاده از دو کارت گرافیک در ComfyUI
استفاده از دو کارت گرافیک در ComfyUI

آیا ComfyUI به‌صورت پیش‌فرض از دو کارت گرافیک استفاده می‌کند؟

خیر. نصب دو کارت گرافیک داخل سیستم به این معنی نیست که ComfyUI به‌صورت خودکار قدرت پردازشی یا VRAM آن‌ها را با یکدیگر ترکیب می‌کند.

در اجرای معمولی، ComfyUI یک GPU را به‌عنوان دستگاه اصلی انتخاب می‌کند و بیشتر Workflow روی همان کارت اجرا می‌شود. کارت دوم تا زمانی که Workflow، Node یا شیوه اجرای برنامه برای استفاده از آن تنظیم نشده باشد، ممکن است تقریباً بیکار بماند.

برای استفاده واقعی از دو کارت چند روش متفاوت وجود دارد:

روش استفادهنتیجه اصلیمناسب برای
اجرای دو ComfyUI Instanceاجرای هم‌زمان دو Job مستقلتولید تعداد زیادی تصویر یا ویدئو
ComfyUI Distributedپخش Jobها میان چند GPU یا چند سیستمBatch Generation و Render Farm محلی
انتقال Model، CLIP یا VAE به GPU دومآزادشدن بخشی از VRAM کارت اصلیWorkflowهای سنگین و کارت‌های متفاوت
MultiGPU CFG Splitافزایش سرعت Sampling یک خروجیدو GPU یکسان و CFG بالاتر از 1
Tensor/Sequence Parallelismتقسیم پردازش یک مدل میان چند GPUمدل‌های بزرگ و Workflowهای تخصصی
FSDP یا Model Shardingتقسیم وزن‌های مدل میان چند کارتاجرای مدلی که روی یک کارت جا نمی‌شود

بنابراین سؤال درست این نیست که «آیا ComfyUI از دو کارت استفاده می‌کند؟»؛ بلکه باید مشخص کنیم هدف، افزایش سرعت یک خروجی است، اجرای خروجی‌های بیشتر است یا اجرای مدلی که روی یک GPU جا نمی‌شود.

قابلیت رسمی Multi-GPU در نسخه‌های جدید ComfyUI

نسخه‌های جدید ComfyUI به Node داخلی MultiGPU CFG Split مجهز شده‌اند. این Node بخش‌های Conditional و Unconditional پردازش CFG را میان چند کارت تقسیم می‌کند و براساس مستندات رسمی، در Workflowهای مناسب تا حدود 1.95× افزایش سرعت ثبت شده است.

این عدد نزدیک به سقف تئوری دو کارت است؛ اما فقط در شرایط مشخص به دست می‌آید:

  • هر دو GPU باید یکسان باشند؛ مانند دو RTX 5090 یا دو RTX 4090.
  • کارت‌ها باید از معماری Ampere یا جدیدتر باشند.
  • مدل باید در VRAM هر کارت به‌صورت مستقل جا شود.
  • مقدار CFG باید بیشتر از 1 باشد.
  • بخش Sampling باید سهم عمده‌ای از زمان کل Workflow را تشکیل دهد.
  • Workflow نباید به‌وسیله VAE Decode، مدل‌های جانبی، Storage یا CPU محدود شده باشد.

فهرست مدل‌های آزمایش‌شده با این قابلیت در مستندات رسمی فعلی شامل موارد زیر است:

  • LTX-2.3
  • Wan 2.2
  • FLUX.2 Klein Base
  • Z-Image
  • Stable Diffusion 3.5 Large
  • Hunyuan Video
  • Qwen-Image-Edit-2511
  • Hunyuan 3D 2.1
  • SDXL

Node مربوط به Multi-GPU باید بعد از Model Loader و Nodeهایی که مدل را تغییر می‌دهند و پیش از Sampler قرار بگیرد.

استفاده از دو کارت گرافیک در ComfyUI
استفاده از دو کارت گرافیک در ComfyUI

محدودیت مهم CFG=1

بسیاری از مدل‌های Distilled یا Workflowهای بهینه‌شده جدید با CFG=1 اجرا می‌شوند. در این حالت، کاری برای تقسیم‌کردن میان دو GPU باقی نمی‌ماند و MultiGPU CFG Split افزایش سرعت ایجاد نمی‌کند.

این موضوع مخصوصاً در Workflowهای جدید ویدئوسازی اهمیت دارد؛ چون ممکن است نام مدل در فهرست مدل‌های پشتیبانی‌شده وجود داشته باشد، اما تنظیمات همان Workflow عملاً قابلیت CFG Split را بی‌اثر کند.

آیا VRAM دو کارت گرافیک با هم جمع می‌شود؟

در حالت عادی خیر.

دو RTX 4090 هرکدام 24GB VRAM دارند، اما ComfyUI آن‌ها را به‌صورت یک کارت 48 گیگابایتی نمی‌بیند. به همین ترتیب، دو RTX 5090 لزوماً یک فضای یکپارچه 64 گیگابایتی در اختیار یک مدل قرار نمی‌دهند.

در MultiGPU CFG Split مدل روی هر دو کارت کپی می‌شود. در نتیجه هر GPU باید بتواند مدل و داده‌های موردنیاز خودش را در VRAM مستقل خود نگه دارد.

ترکیب GPUVRAM هر کارتVRAM قابل‌استفاده یکپارچه در CFG Split
دو RTX 409024GB + 24GBمعمولاً 24GB برای هر Replica
دو RTX 509032GB + 32GBمعمولاً 32GB برای هر Replica
RTX 5090 + RTX 409032GB + 24GBحافظه یکپارچه رسمی تشکیل نمی‌شود

پس اگر یک Workflow برای اجرا روی RTX 4090 به بیشتر از 24GB VRAM احتیاج داشته باشد، اضافه‌کردن RTX 4090 دوم و فعال‌کردن CFG Split الزاماً مشکل کمبود حافظه را حل نمی‌کند.

برای تقسیم واقعی وزن‌های مدل باید از روش‌هایی مانند FSDP، Model Sharding یا بعضی پیاده‌سازی‌های Sequence Parallelism استفاده شود. این روش‌ها به VRAM دو کارت اجازه می‌دهند بخش‌های متفاوت مدل را نگه دارند، اما تنظیمات پیچیده‌تر و سربار ارتباطی بیشتری دارند.

دو RTX 5090 چقدر ComfyUI را سریع‌تر می‌کنند؟

در بهترین حالت رسمی، افزایش سرعت Sampling می‌تواند به حدود 1.95× برسد. یعنی بخشی که روی یک کارت 100 ثانیه زمان می‌برد، در شرایط نزدیک به ایدئال ممکن است در حدود 51 تا 55 ثانیه انجام شود.

اما این عدد به معنی نصف‌شدن زمان کل Workflow نیست.

فرض کنیم یک Workflow چنین زمانی داشته باشد:

مرحلهزمان با یک GPU
بارگذاری مدل‌ها20 ثانیه
Text Encoding5 ثانیه
Sampling100 ثانیه
VAE Decode15 ثانیه
ذخیره خروجی5 ثانیه
زمان کل145 ثانیه

اگر فقط Sampling حدود 1.95 برابر سریع‌تر شود، زمان کل به حدود 96 ثانیه می‌رسد. در این مثال، کارت دوم Sampling را تقریباً دو برابر سریع کرده، اما زمان نهایی Workflow فقط حدود 34 درصد کاهش یافته است.

این تفاوت برای تصمیم خرید بسیار مهم است. عدد 1.95× مربوط به بخش قابل‌تقسیم پردازش است، نه الزاماً تمام زمان تولید تصویر یا ویدئو.

دو RTX 5090 زمانی بیشترین ارزش را دارند که:

  • مدل در 32GB VRAM هر کارت جا شود.
  • CFG بیشتر از 1 باشد.
  • زمان اصلی صرف DiT یا Diffusion Sampling شود.
  • خروجی وضوح بالا یا تعداد Frame زیادی داشته باشد.
  • سیستم از نظر CPU، RAM و Storage کمبودی نداشته باشد.
  • زمان ذخیره‌شده ارزش تجاری داشته باشد.
استفاده از دو کارت گرافیک در ComfyUI
استفاده از دو کارت گرافیک در ComfyUI

دو RTX 4090 چه نتیجه‌ای دارند؟

از نظر قابلیت رسمی، دو RTX 4090 شرایط لازم برای MultiGPU CFG Split را دارند؛ زیرا هر دو هم‌مدل و از معماری Ada هستند.

اگر Workflow روی یک RTX 4090 داخل 24GB VRAM اجرا شود، کارت دوم می‌تواند در مدل‌های سازگار سرعت Sampling را افزایش دهد. انتظار منطقی، طیفی میان افزایش محدود تا نزدیک دو برابر در بخش Sampling است؛ نه دو برابرشدن قطعی کل Workflow.

مزیت مهم RTX 4090 این است که اکوسیستم نرم‌افزاری آن بالغ‌تر است و بسیاری از نسخه‌های PyTorch، CUDA، Triton، SageAttention و Custom Nodeهای ComfyUI مدت بیشتری روی این نسل آزمایش شده‌اند.

محدودیت اصلی همان 24GB VRAM هر کارت است. دو کارت مشکل Workflowهایی را که هر Replica به بیشتر از 24GB نیاز دارند، از طریق CFG Split حل نمی‌کنند.

برای استودیویی که از قبل یک RTX 4090 دارد، خرید 4090 دوم می‌تواند برای این موارد منطقی باشد:

  • اجرای دو Job مستقل به‌صورت هم‌زمان
  • افزایش تعداد خروجی روزانه
  • توزیع Tileهای Upscale
  • اجرای هم‌زمان Generation و Video Upscaling
  • استفاده از CFG Split در Workflowهای سازگار
  • سپردن VAE یا مدل‌های جانبی به کارت دوم

اما اگر مشکل اصلی، جا نشدن مدل در 24GB VRAM باشد، یک RTX 5090 با 32GB حافظه ممکن است انتخاب ساده‌تر و پایدار‌تری باشد.

ترکیب RTX 5090 و RTX 4090 در ComfyUI

قابلیت رسمی MultiGPU CFG Split از ترکیب GPUهای متفاوت پشتیبانی نمی‌کند. بنابراین RTX 5090 و RTX 4090 را نباید با این روش برای سریع‌ترکردن یک Sampling واحد کنار هم قرار داد.

در مستندات فعلی، گزینه‌ای برای تعریف سرعت نسبی GPUها وجود دارد؛ اما Scheduler هنوز از مقدار relative_speed برای توزیع هوشمند بار استفاده نمی‌کند و کار را به‌صورت مساوی تقسیم می‌کند. در نتیجه حتی در راهکارهایی که ترکیب کارت‌های متفاوت را می‌پذیرند، احتمال انتظار کارت سریع‌تر برای کارت کندتر وجود دارد.

بااین‌حال، ترکیب RTX 5090 و RTX 4090 بی‌استفاده نیست. کاربرد مناسب این ترکیب، تقسیم وظایف است:

  • اجرای مدل اصلی یا Sampler روی RTX 5090
  • اجرای VAE Decode روی RTX 4090
  • انتقال CLIP یا Text Encoder به کارت دوم
  • اجرای Upscaler روی RTX 4090
  • تولید ویدئو روی یک کارت و Interpolation یا Upscale روی کارت دیگر
  • اجرای دو ComfyUI Instance مستقل
  • تولید هم‌زمان چند Seed یا چند Shot

Nodeهای رسمی SelectModelDevice، SelectCLIPDevice و SelectVAEDevice اجازه می‌دهند اجزای مختلف Workflow به GPU مشخصی اختصاص پیدا کنند.

این روش معمولاً یک خروجی را دو برابر سریع‌تر نمی‌کند، اما می‌تواند VRAM کارت اصلی را آزاد کند، از Offload به RAM جلوگیری کند و کل Pipeline تولید را روان‌تر کند.

بهترین راه برای تولید تعداد زیادی تصویر یا ویدئو

اگر هدف، تولید چند خروجی با Seedهای متفاوت باشد، تقسیم Jobها معمولاً مطمئن‌تر از تقسیم یک Generation است.

برای مثال:

  • GPU اول ویدئوی شماره یک را تولید می‌کند.
  • GPU دوم هم‌زمان ویدئوی شماره دو را می‌سازد.
  • هر GPU مدل کامل را در VRAM خودش نگه می‌دارد.
  • ارتباط سنگینی میان دو کارت وجود ندارد.

در یک Batch طولانی، این روش می‌تواند Throughput را تقریباً دو برابر کند؛ حتی اگر زمان تولید هر خروجی تغییر نکند.

پروژه ComfyUI-Distributed برای همین نوع استفاده طراحی شده است. این ابزار می‌تواند Workflowها را میان GPUهای داخل یک سیستم، سیستم‌های دیگر شبکه یا Workerهای Cloud توزیع کند. همچنین امکان تقسیم Tileهای Ultimate SD Upscale میان Workerها را دارد.

برای مجموعه‌ای که تبلیغات محصول، چند زاویه دوربین، چند Seed یا تعداد زیادی Shot کوتاه تولید می‌کند، این روش غالباً ارزش عملی بیشتری از تلاش برای دو برابرکردن سرعت یک Shot دارد.

اجرای مدل‌های بزرگ‌تر با تقسیم واقعی مدل

راهکارهایی مانند Raylight از چند نوع Parallelism استفاده می‌کنند:

  • USP یا Unified Sequence Parallelism برای تقسیم Tensorهای تصویر یا ویدئو
  • CFG Parallelism برای تقسیم محاسبات Guidance
  • FSDP برای تقسیم وزن‌های مدل میان GPUها

در Sequence Parallelism، بخش‌های مختلف Tensor میان GPUها پخش می‌شوند. در FSDP نیز هر کارت فقط بخشی از وزن‌های مدل را نگه می‌دارد. این روش به اجرای مدل‌هایی کمک می‌کند که روی VRAM یک کارت جا نمی‌شوند.

بااین‌حال، اینجا دیگر با یک قابلیت ساده و بدون هزینه روبه‌رو نیستیم. GPUها باید در هر مرحله اطلاعاتی را میان خود جابه‌جا کنند و سرعت ارتباط PCIe، توپولوژی مادربرد، نسخه NCCL، سیستم‌عامل و سازگاری مدل اهمیت پیدا می‌کند.

توسعه‌دهندگان Raylight نیز تأکید کرده‌اند که در حالت USP، هر GPU ممکن است همچنان به نسخه کامل وزن‌های مدل احتیاج داشته باشد؛ برای تقسیم وزن‌ها باید FSDP نیز فعال شود. این پروژه همچنین توپولوژی PCIe و ارتباط میان کارت‌ها را بسیار مهم می‌داند.

این راهکار برای کاربران حرفه‌ای، آزمایشگاه‌ها و سیستم‌هایی مناسب است که اجرای مدل بزرگ‌تر برایشان مهم‌تر از سادگی و پایداری ComfyUI است.

کدام مدل‌ها بیشترین استفاده را از دو GPU می‌برند؟

مدل یا WorkflowCFG Split رسمیاجرای Job موازیتقسیم Model یا Tensor
SDXLبله، با CFG بالاتر از 1بسیار مناسبمعمولاً ضروری نیست
Stable Diffusion 3.5 Largeبلهمناسبدر نسخه‌های سنگین قابل‌بررسی
Wan 2.2بله، بسته به تنظیم CFGبسیار مناسببرای Workflowهای سنگین مفید
LTX-2.3بلهبسیار مناسببرای وضوح و Frame بالا مفید
Hunyuan Videoبلهمناسبدر مدل‌های بزرگ کاربردی
FLUX.2 Klein Baseبله، نسخه Baseمناسبوابسته به Quantization
FLUX Dev/Schnellوابسته به Workflow و CFGبسیار مناسببا ابزارهای تخصصی
Qwen Image Editنسخه آزمایش‌شده رسمیمناسبدر Workflowهای بزرگ قابل‌بررسی
Hunyuan 3D 2.1بلهمناسبوابسته به Workflow
Upscalingنه از طریق CFG Splitبسیار مناسبتقسیم Tile بهترین روش است
Frame Interpolationمعمولاً مستقلبسیار مناسبوابسته به Node
SeedVR2 Video Upscalingوابسته به پیاده‌سازیمناسب برای Pipeline موازیباید جداگانه آزمایش شود
MiniMax H3 API Workflowمعمولاً خیرپردازش‌های جانبی قابل‌توزیع‌اندمدل اصلی روی سرویس اجرا می‌شود

وجود نام مدل در فهرست پشتیبانی به معنی افزایش سرعت قطعی نیست. تنظیم CFG، نوع Sampler، Quantization، تعداد Frame، Resolution و Nodeهای جانبی می‌توانند نتیجه را کاملاً تغییر دهند.

RTX 5090 در برابر RTX 4090؛ قبل از کارت دوم چه چیزی مهم است؟

RTX 5090 علاوه بر قدرت پردازشی بیشتر، 32GB VRAM دارد؛ درحالی‌که RTX 4090 به 24GB محدود است. همین 8GB اختلاف می‌تواند بین اجرای کامل مدل داخل VRAM و Offload مداوم به RAM تفاوت ایجاد کند.

در یک آزمایش مستقل Image-to-Video، RTX 5090 زمان پردازش را از حدود 12.7 دقیقه روی RTX 4090 به حدود 7 دقیقه رسانده است؛ یعنی نزدیک 45 درصد سریع‌تر. این عدد فقط به همان Workflow و تنظیمات مربوط است و نباید به تمام مدل‌های ComfyUI تعمیم داده شود.

اختلاف واقعی می‌تواند تحت تأثیر این موارد باشد:

  • نسخه PyTorch و CUDA
  • پشتیبانی صحیح Blackwell
  • نوع Attention
  • استفاده از FP16، BF16، FP8 یا NVFP4
  • Resolution و تعداد Frame
  • میزان Offload به RAM
  • استفاده از Custom Nodeها
  • نسخه Driver
  • زمان بارگذاری و Decode

به همین دلیل، یک RTX 5090 در Workflowی که 32GB VRAM آن مانع Offload می‌شود، ممکن است بسیار بیشتر از اختلاف خام قدرت پردازشی جلو بیفتد. در مقابل، در یک Workflow سبک که کاملاً داخل 24GB کارت 4090 جا می‌شود، فاصله کمتر خواهد بود.

استفاده از دو کارت گرافیک در ComfyUI
استفاده از دو کارت گرافیک در ComfyUI

مادربرد و PCIe در سیستم دو GPU

سیستم دو کارت فقط به داشتن دو Slot فیزیکی محدود نمی‌شود. بسیاری از مادربردهای معمولی، Slot دوم را با پهنای باند x4 یا از طریق Chipset ارائه می‌کنند.

برای Multi-GPU حرفه‌ای باید این موارد بررسی شوند:

  • فاصله فیزیکی مناسب میان دو کارت
  • تقسیم Laneها به‌صورت حداقل x8/x8
  • اتصال مستقیم هر دو Slot به CPU
  • فضای کافی برای کارت‌های 3 تا 4 اسلاته
  • دسترسی آزاد کارت بالایی به هوای خنک
  • توان واقعی پاور و تعداد کابل‌های مستقل
  • تحمل جریان پیوسته در پردازش‌های طولانی
  • ظرفیت RAM متناسب با مدل‌ها
  • پردازنده و پلتفرم دارای Lane کافی

مستند راهنمای NVIDIA برای سیستم دو GPU، برای سطح حرفه‌ای پلتفرم Threadripper، حداقل 128GB RAM و پاورهای 1600 تا 1800 وات را مطرح می‌کند. این اعداد نسخه عمومی برای همه سیستم‌ها نیستند؛ انتخاب نهایی باید براساس مدل دقیق کارت‌ها، Power Limit، پردازنده و تجهیزات جانبی انجام شود.

چالش خنک‌کاری

دو RTX 4090 یا دو RTX 5090 بار حرارتی بسیار بالایی ایجاد می‌کنند. کارت پایینی می‌تواند هوای گرم را مستقیماً وارد ورودی کارت بالایی کند. اگر فاصله کافی وجود نداشته باشد، GPU بالایی ممکن است با افزایش دما، دور فن بیشتر و افت Clock روبه‌رو شود.

بنابراین در یک Workstation دو GPU، طراحی کیس، مسیر هوا، فاصله Slotها و نوع Cooler به‌اندازه انتخاب خود GPU اهمیت دارند.

برای ComfyUI یک RTX 5090 بهتر است یا دو RTX 4090؟

پاسخ به نوع کار بستگی دارد.

یک RTX 5090 انتخاب بهتری است اگر:

  • سادگی و پایداری در اولویت باشد.
  • مدل به بیشتر از 24GB VRAM احتیاج داشته باشد.
  • بیشتر Workflowها با CFG=1 اجرا شوند.
  • معمولاً هر بار فقط یک خروجی تولید شود.
  • مادربرد، پاور یا کیس برای دو GPU مناسب نباشد.
  • Custom Nodeهای موردنیاز با Multi-GPU سازگار نباشند.

دو RTX 4090 انتخاب بهتری هستند اگر:

  • کارت RTX 4090 اول از قبل در اختیار شما باشد.
  • چند خروجی یا Shot هم‌زمان تولید کنید.
  • Workflow روی 24GB هر کارت جا شود.
  • از مدل‌های سازگار با CFG Split استفاده کنید.
  • Upscale، Interpolation و Generation را هم‌زمان انجام دهید.
  • افزایش Throughput از افزایش سرعت یک خروجی مهم‌تر باشد.

دو RTX 5090 مناسب‌اند اگر:

  • بیشترین Performance محلی موردنیاز باشد.
  • Workflow واقعاً از Multi-GPU استفاده کند.
  • کاهش زمان تولید ارزش تجاری مشخص داشته باشد.
  • سیستم از نظر PCIe، پاور و Cooling برای این بار طراحی شده باشد.
  • مدل داخل 32GB هر کارت جا شود یا راهکار Sharding آزمایش‌شده داشته باشید.

ترکیب RTX 5090 و RTX 4090 مناسب است اگر:

  • وظایف دو کارت جدا شوند.
  • RTX 5090 پردازش اصلی را انجام دهد.
  • RTX 4090 برای VAE، Upscale، Interpolation یا Job دوم استفاده شود.
  • انتظار ترکیب خودکار VRAM یا دو برابرشدن سرعت یک Sampling وجود داشته باشد.

روش صحیح Benchmark دو GPU در ComfyUI

برای اینکه نتیجه قابل استناد باشد، باید یک Workflow ثابت ابتدا روی یک GPU و سپس روی دو GPU اجرا شود.

موارد زیر نباید میان تست‌ها تغییر کنند:

  • نسخه ComfyUI
  • نسخه PyTorch و CUDA
  • Driver
  • مدل و Quantization
  • Prompt و Seed
  • Sampler و Scheduler
  • تعداد Step
  • CFG
  • Resolution
  • تعداد Frame
  • VAE
  • Attention Backend
  • LoRAها
  • وضعیت Model Cache
  • Power Limit کارت‌ها

اولین اجرا معمولاً تحت تأثیر بارگذاری مدل و Warm-up است. بهتر است یک اجرای Warm-up کنار گذاشته شود و حداقل سه اجرای بعدی اندازه‌گیری شوند.

علاوه بر زمان کل، این موارد نیز باید ثبت شوند:

  • زمان Model Loading
  • زمان Sampling
  • زمان VAE Decode
  • Peak VRAM هر کارت
  • GPU Utilization
  • مصرف RAM
  • توان مصرفی
  • دمای هر GPU
  • خطا یا افت پایداری

بدون این اطلاعات، جمله «دو کارت 80 درصد سریع‌تر بودند» ارزش فنی زیادی ندارد؛ چون مشخص نیست افزایش سرعت مربوط به کدام مرحله و تحت چه شرایطی بوده است.

سیستم هوش مصنوعی مازستا
سیستم هوش مصنوعی مازستا

جمع‌بندی؛ کارت دوم همیشه سریع‌ترین راه نیست

دو کارت گرافیک در ComfyUI می‌توانند مزیت بسیار مهمی ایجاد کنند، اما نتیجه به روش استفاده از آن‌ها بستگی دارد.

MultiGPU CFG Split رسمی در دو GPU یکسان و Workflowهای دارای CFG بالاتر از 1 می‌تواند Sampling را تا حدود 1.95 برابر سریع‌تر کند. این روش VRAM کارت‌ها را با هم جمع نمی‌کند و هر GPU باید مدل را به‌صورت مستقل در حافظه خود نگه دارد.

برای کارت‌های متفاوت مانند RTX 5090 و RTX 4090، تقسیم وظایف یا اجرای Jobهای مستقل انتخاب منطقی‌تری است. در تولید محتوای تجاری، اجرای هم‌زمان دو Shot، دو Seed یا دو مرحله از Pipeline ممکن است بهره‌وری روزانه را تقریباً دو برابر کند، حتی اگر یک خروجی منفرد سریع‌تر نشود.

اگر مدل در VRAM یک کارت جا نمی‌شود، باید سراغ Model Sharding، FSDP یا Sequence Parallelism رفت؛ راهکارهایی که توانمندتر، اما پیچیده‌تر و حساس‌تر به پلتفرم هستند.

به همین دلیل، پیشنهاد سیستم Multi-GPU باید براساس مدل‌های واقعی، Resolution، تعداد Frame، Workflow و حجم خروجی روزانه انجام شود. در مازستا پیش از پیشنهاد کارت دوم، Workflow اصلی روی سخت‌افزار هدف بررسی می‌شود تا مشخص شود محدودیت واقعی از GPU Compute، ظرفیت VRAM، RAM Offload، Storage یا ساختار خود Workflow است.

مشاوره خرید سیستم هوش مصنوعی

انتخاب سیستم مناسب برای ComfyUI و مدل‌های تولید تصویر یا ویدئو، فقط به خرید قوی‌ترین کارت گرافیک محدود نمی‌شود. ظرفیت VRAM، مدل‌های مورد استفاده، نوع Workflow، تعداد Frame، Resolution، سرعت مورد انتظار و امکان استفاده واقعی از Multi-GPU همگی روی انتخاب نهایی تأثیر دارند. ما در مازستا پیش از پیشنهاد سیستم، نیاز و Workflow شما را بررسی می‌کنیم تا مشخص شود یک کارت قدرتمند، سیستم دو GPU یا Workstation حرفه‌ای کدام‌یک انتخاب منطقی‌تری است. برای دریافت مشاوره تخصصی و پیشنهاد سیستم متناسب با بودجه و نوع پروژه، با کارشناسان مازستا در ارتباط باشید.

ارسال دیدگاه

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مقایسه محصولات

0 محصول

مقایسه محصول
مقایسه محصول
مقایسه محصول
مقایسه محصول