وقتی صحبت از اجرای مدلهای سنگینی مثل Wan 2.2، LTX-2.3، Hunyuan Video، FLUX یا SDXL در ComfyUI میشود، اولین راهکاری که به ذهن میرسد اضافهکردن کارت گرافیک دوم و استفاده از دو کارت گرافیک در ComfyUI است. تصور اولیه هم ساده است: اگر یک RTX 5090 سریع است، دو RTX 5090 باید دو برابر سریعتر باشند و 64GB حافظه گرافیکی در اختیارمان قرار دهند.
اما در عمل، Multi-GPU در ComfyUI به این سادگی کار نمیکند.
گاهی کارت دوم میتواند زمان Sampling را تقریباً نصف کند، گاهی فقط اجازه میدهد دو خروجی را همزمان بگیریم و در بعضی Workflowها نیز هیچ افزایش سرعت محسوسی ایجاد نمیکند. حتی ممکن است دو GPU در Task Manager دیده شوند، اما بخش اصلی پردازش همچنان فقط روی یکی از آنها انجام شود.
در این مقاله بررسی میکنیم که استفاده از دو RTX 4090، دو RTX 5090 یا ترکیب RTX 5090 و RTX 4090 در ComfyUI دقیقاً چه نتیجهای دارد، چه مدلهایی از Multi-GPU استفاده میکنند و چه زمانی خرید کارت دوم تصمیم منطقیتری از ارتقا به یک GPU قویتر است.

آیا ComfyUI بهصورت پیشفرض از دو کارت گرافیک استفاده میکند؟
خیر. نصب دو کارت گرافیک داخل سیستم به این معنی نیست که ComfyUI بهصورت خودکار قدرت پردازشی یا VRAM آنها را با یکدیگر ترکیب میکند.
در اجرای معمولی، ComfyUI یک GPU را بهعنوان دستگاه اصلی انتخاب میکند و بیشتر Workflow روی همان کارت اجرا میشود. کارت دوم تا زمانی که Workflow، Node یا شیوه اجرای برنامه برای استفاده از آن تنظیم نشده باشد، ممکن است تقریباً بیکار بماند.
برای استفاده واقعی از دو کارت چند روش متفاوت وجود دارد:
| روش استفاده | نتیجه اصلی | مناسب برای |
|---|---|---|
| اجرای دو ComfyUI Instance | اجرای همزمان دو Job مستقل | تولید تعداد زیادی تصویر یا ویدئو |
| ComfyUI Distributed | پخش Jobها میان چند GPU یا چند سیستم | Batch Generation و Render Farm محلی |
| انتقال Model، CLIP یا VAE به GPU دوم | آزادشدن بخشی از VRAM کارت اصلی | Workflowهای سنگین و کارتهای متفاوت |
| MultiGPU CFG Split | افزایش سرعت Sampling یک خروجی | دو GPU یکسان و CFG بالاتر از 1 |
| Tensor/Sequence Parallelism | تقسیم پردازش یک مدل میان چند GPU | مدلهای بزرگ و Workflowهای تخصصی |
| FSDP یا Model Sharding | تقسیم وزنهای مدل میان چند کارت | اجرای مدلی که روی یک کارت جا نمیشود |
بنابراین سؤال درست این نیست که «آیا ComfyUI از دو کارت استفاده میکند؟»؛ بلکه باید مشخص کنیم هدف، افزایش سرعت یک خروجی است، اجرای خروجیهای بیشتر است یا اجرای مدلی که روی یک GPU جا نمیشود.
قابلیت رسمی Multi-GPU در نسخههای جدید ComfyUI
نسخههای جدید ComfyUI به Node داخلی MultiGPU CFG Split مجهز شدهاند. این Node بخشهای Conditional و Unconditional پردازش CFG را میان چند کارت تقسیم میکند و براساس مستندات رسمی، در Workflowهای مناسب تا حدود 1.95× افزایش سرعت ثبت شده است.
این عدد نزدیک به سقف تئوری دو کارت است؛ اما فقط در شرایط مشخص به دست میآید:
- هر دو GPU باید یکسان باشند؛ مانند دو RTX 5090 یا دو RTX 4090.
- کارتها باید از معماری Ampere یا جدیدتر باشند.
- مدل باید در VRAM هر کارت بهصورت مستقل جا شود.
- مقدار CFG باید بیشتر از 1 باشد.
- بخش Sampling باید سهم عمدهای از زمان کل Workflow را تشکیل دهد.
- Workflow نباید بهوسیله VAE Decode، مدلهای جانبی، Storage یا CPU محدود شده باشد.
فهرست مدلهای آزمایششده با این قابلیت در مستندات رسمی فعلی شامل موارد زیر است:
LTX-2.3Wan 2.2FLUX.2 Klein BaseZ-ImageStable Diffusion 3.5 LargeHunyuan VideoQwen-Image-Edit-2511Hunyuan 3D 2.1SDXL
Node مربوط به Multi-GPU باید بعد از Model Loader و Nodeهایی که مدل را تغییر میدهند و پیش از Sampler قرار بگیرد.

محدودیت مهم CFG=1
بسیاری از مدلهای Distilled یا Workflowهای بهینهشده جدید با CFG=1 اجرا میشوند. در این حالت، کاری برای تقسیمکردن میان دو GPU باقی نمیماند و MultiGPU CFG Split افزایش سرعت ایجاد نمیکند.
این موضوع مخصوصاً در Workflowهای جدید ویدئوسازی اهمیت دارد؛ چون ممکن است نام مدل در فهرست مدلهای پشتیبانیشده وجود داشته باشد، اما تنظیمات همان Workflow عملاً قابلیت CFG Split را بیاثر کند.
آیا VRAM دو کارت گرافیک با هم جمع میشود؟
در حالت عادی خیر.
دو RTX 4090 هرکدام 24GB VRAM دارند، اما ComfyUI آنها را بهصورت یک کارت 48 گیگابایتی نمیبیند. به همین ترتیب، دو RTX 5090 لزوماً یک فضای یکپارچه 64 گیگابایتی در اختیار یک مدل قرار نمیدهند.
در MultiGPU CFG Split مدل روی هر دو کارت کپی میشود. در نتیجه هر GPU باید بتواند مدل و دادههای موردنیاز خودش را در VRAM مستقل خود نگه دارد.
| ترکیب GPU | VRAM هر کارت | VRAM قابلاستفاده یکپارچه در CFG Split |
|---|---|---|
| دو RTX 4090 | 24GB + 24GB | معمولاً 24GB برای هر Replica |
| دو RTX 5090 | 32GB + 32GB | معمولاً 32GB برای هر Replica |
| RTX 5090 + RTX 4090 | 32GB + 24GB | حافظه یکپارچه رسمی تشکیل نمیشود |
پس اگر یک Workflow برای اجرا روی RTX 4090 به بیشتر از 24GB VRAM احتیاج داشته باشد، اضافهکردن RTX 4090 دوم و فعالکردن CFG Split الزاماً مشکل کمبود حافظه را حل نمیکند.
برای تقسیم واقعی وزنهای مدل باید از روشهایی مانند FSDP، Model Sharding یا بعضی پیادهسازیهای Sequence Parallelism استفاده شود. این روشها به VRAM دو کارت اجازه میدهند بخشهای متفاوت مدل را نگه دارند، اما تنظیمات پیچیدهتر و سربار ارتباطی بیشتری دارند.
دو RTX 5090 چقدر ComfyUI را سریعتر میکنند؟
در بهترین حالت رسمی، افزایش سرعت Sampling میتواند به حدود 1.95× برسد. یعنی بخشی که روی یک کارت 100 ثانیه زمان میبرد، در شرایط نزدیک به ایدئال ممکن است در حدود 51 تا 55 ثانیه انجام شود.
اما این عدد به معنی نصفشدن زمان کل Workflow نیست.
فرض کنیم یک Workflow چنین زمانی داشته باشد:
| مرحله | زمان با یک GPU |
|---|---|
| بارگذاری مدلها | 20 ثانیه |
| Text Encoding | 5 ثانیه |
| Sampling | 100 ثانیه |
| VAE Decode | 15 ثانیه |
| ذخیره خروجی | 5 ثانیه |
| زمان کل | 145 ثانیه |
اگر فقط Sampling حدود 1.95 برابر سریعتر شود، زمان کل به حدود 96 ثانیه میرسد. در این مثال، کارت دوم Sampling را تقریباً دو برابر سریع کرده، اما زمان نهایی Workflow فقط حدود 34 درصد کاهش یافته است.
این تفاوت برای تصمیم خرید بسیار مهم است. عدد 1.95× مربوط به بخش قابلتقسیم پردازش است، نه الزاماً تمام زمان تولید تصویر یا ویدئو.
دو RTX 5090 زمانی بیشترین ارزش را دارند که:
- مدل در 32GB VRAM هر کارت جا شود.
- CFG بیشتر از 1 باشد.
- زمان اصلی صرف DiT یا Diffusion Sampling شود.
- خروجی وضوح بالا یا تعداد Frame زیادی داشته باشد.
- سیستم از نظر CPU، RAM و Storage کمبودی نداشته باشد.
- زمان ذخیرهشده ارزش تجاری داشته باشد.

دو RTX 4090 چه نتیجهای دارند؟
از نظر قابلیت رسمی، دو RTX 4090 شرایط لازم برای MultiGPU CFG Split را دارند؛ زیرا هر دو هممدل و از معماری Ada هستند.
اگر Workflow روی یک RTX 4090 داخل 24GB VRAM اجرا شود، کارت دوم میتواند در مدلهای سازگار سرعت Sampling را افزایش دهد. انتظار منطقی، طیفی میان افزایش محدود تا نزدیک دو برابر در بخش Sampling است؛ نه دو برابرشدن قطعی کل Workflow.
مزیت مهم RTX 4090 این است که اکوسیستم نرمافزاری آن بالغتر است و بسیاری از نسخههای PyTorch، CUDA، Triton، SageAttention و Custom Nodeهای ComfyUI مدت بیشتری روی این نسل آزمایش شدهاند.
محدودیت اصلی همان 24GB VRAM هر کارت است. دو کارت مشکل Workflowهایی را که هر Replica به بیشتر از 24GB نیاز دارند، از طریق CFG Split حل نمیکنند.
برای استودیویی که از قبل یک RTX 4090 دارد، خرید 4090 دوم میتواند برای این موارد منطقی باشد:
- اجرای دو Job مستقل بهصورت همزمان
- افزایش تعداد خروجی روزانه
- توزیع Tileهای Upscale
- اجرای همزمان Generation و Video Upscaling
- استفاده از CFG Split در Workflowهای سازگار
- سپردن VAE یا مدلهای جانبی به کارت دوم
اما اگر مشکل اصلی، جا نشدن مدل در 24GB VRAM باشد، یک RTX 5090 با 32GB حافظه ممکن است انتخاب سادهتر و پایدارتری باشد.
ترکیب RTX 5090 و RTX 4090 در ComfyUI
قابلیت رسمی MultiGPU CFG Split از ترکیب GPUهای متفاوت پشتیبانی نمیکند. بنابراین RTX 5090 و RTX 4090 را نباید با این روش برای سریعترکردن یک Sampling واحد کنار هم قرار داد.
در مستندات فعلی، گزینهای برای تعریف سرعت نسبی GPUها وجود دارد؛ اما Scheduler هنوز از مقدار relative_speed برای توزیع هوشمند بار استفاده نمیکند و کار را بهصورت مساوی تقسیم میکند. در نتیجه حتی در راهکارهایی که ترکیب کارتهای متفاوت را میپذیرند، احتمال انتظار کارت سریعتر برای کارت کندتر وجود دارد.
بااینحال، ترکیب RTX 5090 و RTX 4090 بیاستفاده نیست. کاربرد مناسب این ترکیب، تقسیم وظایف است:
- اجرای مدل اصلی یا Sampler روی RTX 5090
- اجرای VAE Decode روی RTX 4090
- انتقال CLIP یا Text Encoder به کارت دوم
- اجرای Upscaler روی RTX 4090
- تولید ویدئو روی یک کارت و Interpolation یا Upscale روی کارت دیگر
- اجرای دو ComfyUI Instance مستقل
- تولید همزمان چند Seed یا چند Shot
Nodeهای رسمی SelectModelDevice، SelectCLIPDevice و SelectVAEDevice اجازه میدهند اجزای مختلف Workflow به GPU مشخصی اختصاص پیدا کنند.
این روش معمولاً یک خروجی را دو برابر سریعتر نمیکند، اما میتواند VRAM کارت اصلی را آزاد کند، از Offload به RAM جلوگیری کند و کل Pipeline تولید را روانتر کند.
بهترین راه برای تولید تعداد زیادی تصویر یا ویدئو
اگر هدف، تولید چند خروجی با Seedهای متفاوت باشد، تقسیم Jobها معمولاً مطمئنتر از تقسیم یک Generation است.
برای مثال:
- GPU اول ویدئوی شماره یک را تولید میکند.
- GPU دوم همزمان ویدئوی شماره دو را میسازد.
- هر GPU مدل کامل را در VRAM خودش نگه میدارد.
- ارتباط سنگینی میان دو کارت وجود ندارد.
در یک Batch طولانی، این روش میتواند Throughput را تقریباً دو برابر کند؛ حتی اگر زمان تولید هر خروجی تغییر نکند.
پروژه ComfyUI-Distributed برای همین نوع استفاده طراحی شده است. این ابزار میتواند Workflowها را میان GPUهای داخل یک سیستم، سیستمهای دیگر شبکه یا Workerهای Cloud توزیع کند. همچنین امکان تقسیم Tileهای Ultimate SD Upscale میان Workerها را دارد.
برای مجموعهای که تبلیغات محصول، چند زاویه دوربین، چند Seed یا تعداد زیادی Shot کوتاه تولید میکند، این روش غالباً ارزش عملی بیشتری از تلاش برای دو برابرکردن سرعت یک Shot دارد.
محصولات بر اساس دستهبندی
-
سیستم پروژکشن و ویدیو وال 16 تصویره VW16
1,185,000,000 تومان -
سیستم رندرینگ معماری AMD 9
639,000,000 تومان -
سیستم رندرینگ معماری AMD 7
450,000,000 تومان -
سیستم رندر و انیمیشن معماری A95
665,000,000 تومان -
سیستم تریدینگ 4 مانیتوره TR4
293,000,000 تومان
اجرای مدلهای بزرگتر با تقسیم واقعی مدل
راهکارهایی مانند Raylight از چند نوع Parallelism استفاده میکنند:
USPیا Unified Sequence Parallelism برای تقسیم Tensorهای تصویر یا ویدئوCFG Parallelismبرای تقسیم محاسبات GuidanceFSDPبرای تقسیم وزنهای مدل میان GPUها
در Sequence Parallelism، بخشهای مختلف Tensor میان GPUها پخش میشوند. در FSDP نیز هر کارت فقط بخشی از وزنهای مدل را نگه میدارد. این روش به اجرای مدلهایی کمک میکند که روی VRAM یک کارت جا نمیشوند.
بااینحال، اینجا دیگر با یک قابلیت ساده و بدون هزینه روبهرو نیستیم. GPUها باید در هر مرحله اطلاعاتی را میان خود جابهجا کنند و سرعت ارتباط PCIe، توپولوژی مادربرد، نسخه NCCL، سیستمعامل و سازگاری مدل اهمیت پیدا میکند.
توسعهدهندگان Raylight نیز تأکید کردهاند که در حالت USP، هر GPU ممکن است همچنان به نسخه کامل وزنهای مدل احتیاج داشته باشد؛ برای تقسیم وزنها باید FSDP نیز فعال شود. این پروژه همچنین توپولوژی PCIe و ارتباط میان کارتها را بسیار مهم میداند.
این راهکار برای کاربران حرفهای، آزمایشگاهها و سیستمهایی مناسب است که اجرای مدل بزرگتر برایشان مهمتر از سادگی و پایداری ComfyUI است.
کدام مدلها بیشترین استفاده را از دو GPU میبرند؟
| مدل یا Workflow | CFG Split رسمی | اجرای Job موازی | تقسیم Model یا Tensor |
|---|---|---|---|
| SDXL | بله، با CFG بالاتر از 1 | بسیار مناسب | معمولاً ضروری نیست |
| Stable Diffusion 3.5 Large | بله | مناسب | در نسخههای سنگین قابلبررسی |
| Wan 2.2 | بله، بسته به تنظیم CFG | بسیار مناسب | برای Workflowهای سنگین مفید |
| LTX-2.3 | بله | بسیار مناسب | برای وضوح و Frame بالا مفید |
| Hunyuan Video | بله | مناسب | در مدلهای بزرگ کاربردی |
| FLUX.2 Klein Base | بله، نسخه Base | مناسب | وابسته به Quantization |
| FLUX Dev/Schnell | وابسته به Workflow و CFG | بسیار مناسب | با ابزارهای تخصصی |
| Qwen Image Edit | نسخه آزمایششده رسمی | مناسب | در Workflowهای بزرگ قابلبررسی |
| Hunyuan 3D 2.1 | بله | مناسب | وابسته به Workflow |
| Upscaling | نه از طریق CFG Split | بسیار مناسب | تقسیم Tile بهترین روش است |
| Frame Interpolation | معمولاً مستقل | بسیار مناسب | وابسته به Node |
| SeedVR2 Video Upscaling | وابسته به پیادهسازی | مناسب برای Pipeline موازی | باید جداگانه آزمایش شود |
| MiniMax H3 API Workflow | معمولاً خیر | پردازشهای جانبی قابلتوزیعاند | مدل اصلی روی سرویس اجرا میشود |
وجود نام مدل در فهرست پشتیبانی به معنی افزایش سرعت قطعی نیست. تنظیم CFG، نوع Sampler، Quantization، تعداد Frame، Resolution و Nodeهای جانبی میتوانند نتیجه را کاملاً تغییر دهند.
RTX 5090 در برابر RTX 4090؛ قبل از کارت دوم چه چیزی مهم است؟
RTX 5090 علاوه بر قدرت پردازشی بیشتر، 32GB VRAM دارد؛ درحالیکه RTX 4090 به 24GB محدود است. همین 8GB اختلاف میتواند بین اجرای کامل مدل داخل VRAM و Offload مداوم به RAM تفاوت ایجاد کند.
در یک آزمایش مستقل Image-to-Video، RTX 5090 زمان پردازش را از حدود 12.7 دقیقه روی RTX 4090 به حدود 7 دقیقه رسانده است؛ یعنی نزدیک 45 درصد سریعتر. این عدد فقط به همان Workflow و تنظیمات مربوط است و نباید به تمام مدلهای ComfyUI تعمیم داده شود.
اختلاف واقعی میتواند تحت تأثیر این موارد باشد:
- نسخه PyTorch و CUDA
- پشتیبانی صحیح Blackwell
- نوع Attention
- استفاده از FP16، BF16، FP8 یا NVFP4
- Resolution و تعداد Frame
- میزان Offload به RAM
- استفاده از Custom Nodeها
- نسخه Driver
- زمان بارگذاری و Decode
به همین دلیل، یک RTX 5090 در Workflowی که 32GB VRAM آن مانع Offload میشود، ممکن است بسیار بیشتر از اختلاف خام قدرت پردازشی جلو بیفتد. در مقابل، در یک Workflow سبک که کاملاً داخل 24GB کارت 4090 جا میشود، فاصله کمتر خواهد بود.

مادربرد و PCIe در سیستم دو GPU
سیستم دو کارت فقط به داشتن دو Slot فیزیکی محدود نمیشود. بسیاری از مادربردهای معمولی، Slot دوم را با پهنای باند x4 یا از طریق Chipset ارائه میکنند.
برای Multi-GPU حرفهای باید این موارد بررسی شوند:
- فاصله فیزیکی مناسب میان دو کارت
- تقسیم Laneها بهصورت حداقل
x8/x8 - اتصال مستقیم هر دو Slot به CPU
- فضای کافی برای کارتهای 3 تا 4 اسلاته
- دسترسی آزاد کارت بالایی به هوای خنک
- توان واقعی پاور و تعداد کابلهای مستقل
- تحمل جریان پیوسته در پردازشهای طولانی
- ظرفیت RAM متناسب با مدلها
- پردازنده و پلتفرم دارای Lane کافی
مستند راهنمای NVIDIA برای سیستم دو GPU، برای سطح حرفهای پلتفرم Threadripper، حداقل 128GB RAM و پاورهای 1600 تا 1800 وات را مطرح میکند. این اعداد نسخه عمومی برای همه سیستمها نیستند؛ انتخاب نهایی باید براساس مدل دقیق کارتها، Power Limit، پردازنده و تجهیزات جانبی انجام شود.
چالش خنککاری
دو RTX 4090 یا دو RTX 5090 بار حرارتی بسیار بالایی ایجاد میکنند. کارت پایینی میتواند هوای گرم را مستقیماً وارد ورودی کارت بالایی کند. اگر فاصله کافی وجود نداشته باشد، GPU بالایی ممکن است با افزایش دما، دور فن بیشتر و افت Clock روبهرو شود.
بنابراین در یک Workstation دو GPU، طراحی کیس، مسیر هوا، فاصله Slotها و نوع Cooler بهاندازه انتخاب خود GPU اهمیت دارند.
برای ComfyUI یک RTX 5090 بهتر است یا دو RTX 4090؟
پاسخ به نوع کار بستگی دارد.
یک RTX 5090 انتخاب بهتری است اگر:
- سادگی و پایداری در اولویت باشد.
- مدل به بیشتر از 24GB VRAM احتیاج داشته باشد.
- بیشتر Workflowها با CFG=1 اجرا شوند.
- معمولاً هر بار فقط یک خروجی تولید شود.
- مادربرد، پاور یا کیس برای دو GPU مناسب نباشد.
- Custom Nodeهای موردنیاز با Multi-GPU سازگار نباشند.
دو RTX 4090 انتخاب بهتری هستند اگر:
- کارت RTX 4090 اول از قبل در اختیار شما باشد.
- چند خروجی یا Shot همزمان تولید کنید.
- Workflow روی 24GB هر کارت جا شود.
- از مدلهای سازگار با CFG Split استفاده کنید.
- Upscale، Interpolation و Generation را همزمان انجام دهید.
- افزایش Throughput از افزایش سرعت یک خروجی مهمتر باشد.
دو RTX 5090 مناسباند اگر:
- بیشترین Performance محلی موردنیاز باشد.
- Workflow واقعاً از Multi-GPU استفاده کند.
- کاهش زمان تولید ارزش تجاری مشخص داشته باشد.
- سیستم از نظر PCIe، پاور و Cooling برای این بار طراحی شده باشد.
- مدل داخل 32GB هر کارت جا شود یا راهکار Sharding آزمایششده داشته باشید.
ترکیب RTX 5090 و RTX 4090 مناسب است اگر:
- وظایف دو کارت جدا شوند.
- RTX 5090 پردازش اصلی را انجام دهد.
- RTX 4090 برای VAE، Upscale، Interpolation یا Job دوم استفاده شود.
- انتظار ترکیب خودکار VRAM یا دو برابرشدن سرعت یک Sampling وجود داشته باشد.
روش صحیح Benchmark دو GPU در ComfyUI
برای اینکه نتیجه قابل استناد باشد، باید یک Workflow ثابت ابتدا روی یک GPU و سپس روی دو GPU اجرا شود.
موارد زیر نباید میان تستها تغییر کنند:
- نسخه ComfyUI
- نسخه PyTorch و CUDA
- Driver
- مدل و Quantization
- Prompt و Seed
- Sampler و Scheduler
- تعداد Step
- CFG
- Resolution
- تعداد Frame
- VAE
- Attention Backend
- LoRAها
- وضعیت Model Cache
- Power Limit کارتها
اولین اجرا معمولاً تحت تأثیر بارگذاری مدل و Warm-up است. بهتر است یک اجرای Warm-up کنار گذاشته شود و حداقل سه اجرای بعدی اندازهگیری شوند.
علاوه بر زمان کل، این موارد نیز باید ثبت شوند:
- زمان Model Loading
- زمان Sampling
- زمان VAE Decode
- Peak VRAM هر کارت
- GPU Utilization
- مصرف RAM
- توان مصرفی
- دمای هر GPU
- خطا یا افت پایداری
بدون این اطلاعات، جمله «دو کارت 80 درصد سریعتر بودند» ارزش فنی زیادی ندارد؛ چون مشخص نیست افزایش سرعت مربوط به کدام مرحله و تحت چه شرایطی بوده است.

جمعبندی؛ کارت دوم همیشه سریعترین راه نیست
دو کارت گرافیک در ComfyUI میتوانند مزیت بسیار مهمی ایجاد کنند، اما نتیجه به روش استفاده از آنها بستگی دارد.
MultiGPU CFG Split رسمی در دو GPU یکسان و Workflowهای دارای CFG بالاتر از 1 میتواند Sampling را تا حدود 1.95 برابر سریعتر کند. این روش VRAM کارتها را با هم جمع نمیکند و هر GPU باید مدل را بهصورت مستقل در حافظه خود نگه دارد.
برای کارتهای متفاوت مانند RTX 5090 و RTX 4090، تقسیم وظایف یا اجرای Jobهای مستقل انتخاب منطقیتری است. در تولید محتوای تجاری، اجرای همزمان دو Shot، دو Seed یا دو مرحله از Pipeline ممکن است بهرهوری روزانه را تقریباً دو برابر کند، حتی اگر یک خروجی منفرد سریعتر نشود.
اگر مدل در VRAM یک کارت جا نمیشود، باید سراغ Model Sharding، FSDP یا Sequence Parallelism رفت؛ راهکارهایی که توانمندتر، اما پیچیدهتر و حساستر به پلتفرم هستند.
به همین دلیل، پیشنهاد سیستم Multi-GPU باید براساس مدلهای واقعی، Resolution، تعداد Frame، Workflow و حجم خروجی روزانه انجام شود. در مازستا پیش از پیشنهاد کارت دوم، Workflow اصلی روی سختافزار هدف بررسی میشود تا مشخص شود محدودیت واقعی از GPU Compute، ظرفیت VRAM، RAM Offload، Storage یا ساختار خود Workflow است.
مشاوره خرید سیستم هوش مصنوعی
انتخاب سیستم مناسب برای ComfyUI و مدلهای تولید تصویر یا ویدئو، فقط به خرید قویترین کارت گرافیک محدود نمیشود. ظرفیت VRAM، مدلهای مورد استفاده، نوع Workflow، تعداد Frame، Resolution، سرعت مورد انتظار و امکان استفاده واقعی از Multi-GPU همگی روی انتخاب نهایی تأثیر دارند. ما در مازستا پیش از پیشنهاد سیستم، نیاز و Workflow شما را بررسی میکنیم تا مشخص شود یک کارت قدرتمند، سیستم دو GPU یا Workstation حرفهای کدامیک انتخاب منطقیتری است. برای دریافت مشاوره تخصصی و پیشنهاد سیستم متناسب با بودجه و نوع پروژه، با کارشناسان مازستا در ارتباط باشید.










