LTX 2.5 چیست؟ آموزش اجرای هوش مصنوعی ساخت ویدیو در ComfyUI
LTX 2.5 یکی از جدیدترین مدلهای تولید ویدیو با هوش مصنوعی از شرکت Lightricks است که برای ساخت ویدیو بهصورت محلی، تولید ویدیو همراه با صدا و اجرای ورکفلوهای پیشرفته در ابزارهایی مثل ComfyUI توسعه پیدا کرده است.
یکی از مهمترین ویژگیهای LTX 2.5 این است که وزنهای مدل برای دانلود و اجرای محلی در دسترس قرار گرفتهاند. در نتیجه میتوان مدل را روی سختافزار شخصی اجرا کرد و برخلاف سرویسهای کاملاً ابری، کنترل بیشتری روی فرایند تولید ویدیو داشت. LTX همچنین قابلیتهایی مثل Native Multishot، درک بهتر پرامپت، تولید همزمان صدا و تصویر، Native 4K HDR و مدل Distilled را برای این نسخه معرفی کرده است.
در این مقاله قرار است این مدل را بررسی کنیم، قابلیتهای آن را ببینیم، نحوه اجرای آن در ComfyUI را توضیح دهیم، مدلهای موردنیاز را معرفی کنیم و ببینیم آیا میتوان LTX 2.5 را روی کارتهای گرافیک 8GB نیز اجرا کرد یا نه.
LTX 2.5 چیست؟
LTX 2.5 یک مدل پیشرفته تولید محتوای صوتی و تصویری از Lightricks است که با هدف اجرای محلی، توسعه و Fine-tune کردن مدل و استفاده در محصولات مختلف منتشر شده است.
برخلاف بسیاری از سرویسهای تولید ویدیو که فقط از طریق وبسایت یا API در دسترس هستند، این مدل بهصورت Open Weights منتشر شده و میتوان وزنهای آن را دریافت و روی سختافزار شخصی اجرا کرد.
LTX در صفحه رسمی خود قابلیتهایی مانند موارد زیر را برای این مدل معرفی کرده است:
- تولید ویدیو با کیفیت بالا
- تولید صدا و ویدیو بهصورت هماهنگ
- Native Multishot
- درک بهتر پرامپت
- تولید خودکار مدت ویدیو
- Native 4K HDR
- پشتیبانی از RAW Workflow
- اجرای محلی
- امکان Fine-tune کردن مدل
- مدل Distilled با سرعت بالاتر
قابلیتهای LTX 2.5
تولید ویدیو همراه با صدا
یکی از ویژگیهای مهم LTX 2.5، تولید همزمان محتوای صوتی و تصویری است.
در ورکفلوهای رسمی ComfyUI، این مدل از VAE جداگانه برای ویدیو و صدا استفاده میکند. بنابراین میتوان ویدیو و soundtrack آن را در یک فرایند تولید کرد.
این قابلیت برای ساخت ویدیوهای تبلیغاتی، سینمایی، محتوای شبکههای اجتماعی و پروژههایی که به هماهنگی تصویر و صدا نیاز دارند، کاربرد دارد.
Native Multishot
LTX 2.5 قابلیت Native Multishot را نیز ارائه میکند.
در این حالت مدل میتواند چند شات مرتبط را تولید کند و مواردی مانند شخصیت، محیط، نورپردازی و صدا را بین شاتها حفظ کند.
این قابلیت برای ساخت سکانسهای داستانی و ویدیوهایی که از چند نمای متوالی تشکیل شدهاند، اهمیت زیادی دارد.
درک بهتر پرامپت
این مدل از Gemma 4 12B بهعنوان Text Encoder استفاده میکند و یک Prompt Enhancer نیز در ورکفلوهای آن وجود دارد.
این تغییر برای درک بهتر پرامپتهای پیچیده، شامل شخصیتهای مختلف، حرکات دوربین، نورپردازی و اتفاقات داخل صحنه طراحی شده است.
تولید خودکار مدت ویدیو
این مدل جدید قابلیت Auto Duration را نیز معرفی کرده است.
این قابلیت به مدل اجازه میدهد مدت مناسب کلیپ را بر اساس اکشن یا درخواست موجود در پرامپت پیشبینی کند.
پشتیبانی از 4K HDR
LTX 2.5 قابلیت Native 4K HDR را نیز در معماری خود ارائه میکند. البته پشتیبانی از یک قابلیت به این معنی نیست که تمام کارتهای گرافیک میتوانند 4K را با سرعت مناسب تولید کنند و سختافزار موردنیاز به ورکفلو و تنظیمات بستگی دارد.
برای سیستمهای معمولی، بهتر است ابتدا تولید را با رزولوشن پایینتر تست کنید و سپس سراغ رزولوشنهای بالاتر بروید.
آیا LTX 2.5 روی ComfyUI اجرا میشود؟
بله. LTX 2.5 بهصورت رسمی از ComfyUI پشتیبانی میکند.
LTX برای ComfyUI ورکفلوهای آماده Text-to-Video، Image-to-Video و First Frame / Last Frame ارائه کرده است.
برای اجرای LTX 2.5 در ComfyUI میتوان از نود رسمی ComfyUI-LTXVideo استفاده کرد.
اگر هنوز ComfyUI را نصب نکردهاید، ابتدا آموزش زیر را ببینید:
بعد از نصب ComfyUI، میتوان نودهای LTX را از طریق ComfyUI Manager نصب کرد. مستندات رسمی LTX همچنین روش نصب دستی ComfyUI-LTXVideo را ارائه کردهاند.
ورکفلوهای آماده LTX 2.5 در ComfyUI
در نسخههای جدید ComfyUI، ورکفلوهای آماده این مدل در دسترس هستند.
مهمترین آنها عبارتاند از:
- Text-to-Video: تولید ویدیو از متن
- Image-to-Video: تبدیل تصویر به ویدیو
- First Frame / Last Frame: تولید حرکت بین فریم ابتدایی و انتهایی
مستندات رسمی LTX پیشنهاد میکنند برای شروع، ابتدا با رزولوشن پایینتر و تعداد فریم کمتر تست انجام شود و بعد کیفیت و رزولوشن افزایش پیدا کند.
آیا LTX 2.5 روی کارت گرافیک 8 گیگ اجرا میشود؟
LTX در صفحه رسمی خود 16GB VRAM را بهعنوان حداقل VRAM در جدول مشخصات اجرای مدل اعلام کرده است. این مقدار مربوط به کانفیگ رسمی و استاندارد مدل است.
اما در عمل، نسخههای Quantized، INT8 و GGUF امکان اجرای این مدل را روی سیستمهای دارای VRAM کمتر فراهم کردهاند.
برای مثال، ورکفلوهای جامعه ComfyUI برای این مدل روی RTX 5060 Laptop با 8GB VRAM اجرا شدهاند و حتی نمونههایی از تولید ویدیوی 1080p با نسخه INT8 گزارش شده است.
همچنین یک ورکفلو دیگر برای این مدل روی RTX 4060 Laptop با 8GB VRAM و 16GB RAM تست شده و از DynamicVRAM و Offloading برای انتقال بخشی از مدل بین VRAM و RAM استفاده کرده است.
بنابراین:
بله، LTX 2.5 روی کارتهای 8GB نیز قابل اجراست، اما معمولاً باید از نسخههای کمحافظه و تنظیمات بهینهشده استفاده کنید.
در این حالت سرعت تولید میتواند پایینتر باشد و محدودیتهایی در رزولوشن، تعداد فریم، مدت ویدیو و سایر تنظیمات وجود داشته باشد.
نسخههای GGUF برای LTX 2.5
یکی از دلایل مهمی که اجرای این مدل روی سیستمهای ضعیفتر امکانپذیر شده، انتشار نسخههای GGUF Quantized است.
برای نمونه، یکی از مخازن GGUF جامعه برای LTX 2.5 نسخههایی مانند Q2، Q3، Q4، Q5، Q6 و Q8 را ارائه میکند. این نسخهها حجم مدل را نسبت به وزنهای اصلی کاهش میدهند.
در یک نمونه دیگر از مدل GGUF برای ComfyUI، نسخه Q4 برای استفاده با کارتهای 16 تا 24GB پیشنهاد شده است و نسخههای با Quantization بالاتر به VRAM بیشتری نیاز دارند.
نکته مهم این است که حجم فایل مدل با مقدار VRAM موردنیاز برای تولید یکی نیست؛ هنگام تولید ویدیو علاوه بر وزن مدل، حافظه موردنیاز برای Context، VAE، Text Encoder و سایر بخشهای ورکفلو نیز مصرف میشود.
به همین دلیل ممکن است یک فایل GGUF روی دیسک مثلاً چند گیگابایت باشد، اما اجرای واقعی آن به VRAM و RAM بیشتری نیاز داشته باشد.
مشخصات پیشنهادی برای اجرای مدل
نیاز سختافزاری این مدل به نوع مدل و ورکفلو بستگی دارد.
مشخصات سیستم وضعیت 8GB VRAM قابل اجرا با نسخههای کمحافظه، INT8/GGUF و Offloading؛ مناسب برای تست و ورکفلوهای بهینه 12GB VRAM شرایط بهتر برای مدلهای Quantized و رزولوشنهای پایینتر 16GB VRAM حداقل اعلامشده برای کانفیگ رسمی LTX 24GB VRAM مناسبتر برای ورکفلوهای سنگینتر 32GB VRAM یا بیشتر مناسب برای مدلهای بزرگتر و تنظیمات سنگین
در RAM نیز هرچه ظرفیت بیشتر باشد، در سیستمهای Low-VRAM کمک بیشتری خواهید گرفت؛ مخصوصاً زمانی که بخشی از مدل با Offloading بین RAM و VRAM جابهجا میشود.
برای مثال، یک ورکفلو آزمایششده روی RTX 4060 Laptop با 8GB VRAM از 16GB RAM استفاده کرده است، در حالی که یک تست دیگر روی RTX 5060 Laptop با 8GB VRAM، استفاده از بیش از 24GB RAM را برای تجربه روانتر پیشنهاد کرده است.
برای شروع چه تنظیماتی مناسب است؟
اگر سیستم شما VRAM کمی دارد، بهتر است مستقیماً سراغ رزولوشن و تعداد فریم بالا نروید.
مستندات رسمی LTX برای شروع پیشنهاد میکنند:
- رزولوشن حدود 480×720 را امتحان کنید.
- از حدود 41 تا 81 فریم شروع کنید.
- ابتدا یک خروجی کوتاه بگیرید.
- بعد از اطمینان از عملکرد ورکفلو، رزولوشن و تعداد فریم را افزایش دهید.
- در سیستمهای Low-VRAM از مدلهای Quantized استفاده کنید.
این روش باعث میشود قبل از اجرای یک رندر سنگین، مطمئن شوید مدل و Workflow بهدرستی روی سیستم شما کار میکنند.
مدلهای موردنیاز LTX 2.5 را از کجا دانلود کنیم؟
دانلود مدل ها از سایت mohtips:
| مدل اصلی | |
| مدل ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors | دانلود(2۰گیگابایت) |
| مدل ltx-2.5-22b-distilled-transformer-nvfp4.safetensors | دانلود(۱۸گیگابایت) |
| مدل های انکودر | |
| gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors | دانلود(۱۵گیگابایت) |
| فایل های VAE | |
| ltx-2.5-audio-vae-bf16.safetensors | دانلود(348مگابایت) |
| ltx-2.5-video-vae-bf16.safetensors | دانلود(1.4گیگابایت) |
| فایل upscale | |
| ltx-2.5-video-vae-bf16.safetensors | دانلود(930مگابایت) |
مدلهای رسمی در Hugging Face منتشر شدهاند.
دانلود مدل رسمی
دانلود LTX 2.5 از Hugging Face
در مخزن رسمی میتوانید وزنها و فایلهای موردنیاز برای اجرای مدل را دریافت کنید.
برای اجرای این مدل در ComfyUI، بسته به Workflow به فایلهایی مانند Transformer، Text Encoder، Video VAE، Audio VAE و Spatial Upscaler نیاز خواهید داشت.
مستندات رسمی مسیرهای مربوط به مدلها را نیز مشخص کردهاند:
ComfyUI/models/diffusion_models/
ComfyUI/models/text_encoders/
ComfyUI/models/vae/
ComfyUI/models/latent_upscale_models/
ComfyUI/models/loras/
دانلود نسخههای GGUF LTX 2.5
اگر VRAM سیستم شما پایین است، میتوانید سراغ نسخههای Quantized و GGUF بروید.
یکی از مخازن جامعه برای این مدل نسخههای مختلف GGUF را ارائه کرده است:
دانلود LTX 2.5 GGUF از Hugging Face
این مخزن نسخههایی مانند Q2_K، Q3_K_S، Q4_K_M، Q5_K_M، Q6_K و Q8_0 را ارائه میکند.
یک مخزن دیگر نیز نسخههای GGUF سازگار با ComfyUI-GGUF و Workflowهای آماده برای Text-to-Video، Image-to-Video و First/Last Frame را ارائه کرده است:
دانلود LTX 2.5 GGUF و ورکفلوهای ComfyUI
نکته: نسخههای GGUF معرفیشده در این بخش، تبدیلهای جامعه هستند و لزوماً همان فایلهای اصلی منتشرشده توسط Lightricks نیستند. برای فایلهای اصلی همیشه مخزن رسمی Lightricks را مبنا قرار دهید.
LTX 2.5 در ComfyUI چه مدلهایی دارد؟
برای اجرای این مدل میتوانید بسته به سختافزار خود از کانفیگهای مختلف استفاده کنید.
مدل اصلی BF16
نسخه BF16 کیفیت بالایی دارد اما به حافظه بیشتری نیاز دارد و برای سیستمهای دارای VRAM پایین گزینه مناسبی نیست.
نسخه INT8
LTX برای ComfyUI نسخههای INT8 ConvRot را نیز معرفی کرده است که برای کاهش مصرف حافظه طراحی شدهاند. مستندات رسمی LTX استفاده از این فایلها را برای کانفیگهای Low-VRAM پیشنهاد میکنند.
نسخه GGUF
نسخههای GGUF که توسط جامعه ساخته شدهاند، گزینه دیگری برای اجرای Quantized هستند و با ابزارهایی مانند ComfyUI-GGUF قابل استفادهاند.
LTX 2.5 برای چه کسانی مناسب است؟
این مدل جدید میتواند برای گروههای مختلفی کاربرد داشته باشد:
- تولیدکنندگان محتوای ویدیویی
- سازندگان ویدیوهای تبلیغاتی
- فیلمسازان و AI Filmmakerها
- تولیدکنندگان محتوای یوتیوب
- سازندگان محتوای اینستاگرام
- طراحان ویدیوهای سینمایی
- توسعهدهندگان ابزارهای هوش مصنوعی
- کاربران ComfyUI
- افرادی که به اجرای Local AI علاقه دارند
مزیت مهم LTX 2.5 برای کاربران Local AI این است که مدل را میتوان روی سختافزار شخصی اجرا کرد و به API یک سرویس ابری وابسته نبود.
تفاوت LTX 2.5 با سرویسهای آنلاین ساخت ویدیو
بسیاری از ابزارهای محبوب ساخت ویدیو با هوش مصنوعی بهصورت سرویس ابری ارائه میشوند؛ یعنی تولید ویدیو روی سرور شرکت انجام میشود.
این مدل یک مسیر متفاوت دارد.
با استفاده از وزنهای قابل دانلود میتوانید مدل را روی سیستم خودتان اجرا کنید، Workflow را تغییر دهید، از ComfyUI استفاده کنید و حتی مدل را روی دادههای خود Fine-tune کنید. LTX نیز اجرای Local، Fine-tuning و Deployment روی سختافزار تحت کنترل کاربر را جزو قابلیتهای مدل معرفی میکند.
البته اجرای Local به این معنی است که باید هزینه سختافزار، فضای ذخیرهسازی، زمان تولید و مصرف برق را نیز در نظر بگیرید.
آیا LTX 2.5 رایگان است؟
وزنهای LTX 2.5 برای اجرای محلی در دسترس هستند و LTX در صفحه رسمی خود اجرای مدل را بهصورت Local معرفی میکند.
با این حال، مدل تحت شرایط مجوز مخصوص خود منتشر شده است و قبل از استفاده تجاری باید LTX-2.x Community License را بررسی کنید.
بهخصوص اگر قرار است از مدل برای یک محصول تجاری یا سرویس درآمدزا استفاده کنید، شرایط فعلی مجوز را مستقیماً از منبع رسمی بررسی کنید.
آموزش سریع اجرای LTX 2.5 در ComfyUI
برای شروع، مراحل کلی به این شکل است:
مرحله اول: نصب ComfyUI
ابتدا ComfyUI را روی سیستم خود نصب کنید.
اگر قبلاً ComfyUI را نصب کردهاید، میتوانید مستقیماً سراغ مرحله بعد بروید.
[لینک داخلی آموزش ComfyUI در Mohtips]
مرحله دوم: نصب LTXVideo
از ComfyUI Manager، نود LTXVideo را نصب کنید.
در صورت نصب دستی نیز مخزن رسمی LTX برای این کار در دسترس است.
مرحله سوم: دانلود مدلها
مدلهای موردنیاز را از Hugging Face دریافت کنید و در پوشههای صحیح ComfyUI قرار دهید.
برای کانفیگ Low-VRAM بهتر است از نسخههای Quantized یا INT8 استفاده کنید.
مرحله چهارم: اجرای Workflow
یکی از Workflowهای رسمی LTX 2.5 را باز کنید.
برای شروع میتوانید از:
Text-to-Video
یا
Image-to-Video
استفاده کنید.
مرحله پنجم: تست با تنظیمات سبک
قبل از اینکه رزولوشن را بالا ببرید، یک ویدیوی کوتاه با تعداد فریم پایین تولید کنید.
اگر خروجی بدون خطا تولید شد، میتوانید بهتدریج رزولوشن، تعداد فریم و کیفیت را افزایش دهید.
جمعبندی؛ آیا LTX 2.5 ارزش امتحان کردن دارد؟
LTX 2.5 یک مدل Open Weights برای تولید ویدیو است که امکاناتی مانند تولید صدا و تصویر، Multishot، درک بهتر پرامپت، Auto Duration و Native 4K HDR را ارائه میکند.
نکته مهم برای کاربران ایرانی و علاقهمندان به Local AI این است که LTX 2.5 را میتوان در ComfyUI اجرا کرد و در کنار نسخه اصلی، گزینههای Low-VRAM مانند INT8 و نسخههای GGUF جامعه نیز وجود دارند.
اگر کارت گرافیک قدرتمندی مثل 16، 24 یا 32GB VRAM دارید، دست شما برای استفاده از Workflowهای سنگینتر بازتر است.
اما حتی با 8GB VRAM نیز نمونههای عملی اجرای LTX 2.5 وجود دارد؛ البته با Quantization، Offloading و تنظیمات مخصوص سیستمهای Low-VRAM.
برای شروع پیشنهاد میشود ابتدا یک Workflow سبک را با رزولوشن پایین اجرا کنید و بعد از اطمینان از عملکرد صحیح، سراغ رزولوشن و تعداد فریم بالاتر بروید.
لینکهای مهم LTX 2.5
سایت رسمی LTX 2.5:
https://ltx.io/model/ltx-2-5
مدل رسمی LTX 2.5 در Hugging Face:
https://huggingface.co/Lightricks/LTX-2.5
مستندات رسمی LTX برای ComfyUI:
https://docs.ltx.io/open-source-model/integration-tools/comfy-ui
ComfyUI-LTXVideo در GitHub:
https://github.com/Lightricks/ComfyUI-LTXVideo
LTX 2.5 GGUF در Hugging Face:
https://huggingface.co/ruygar/LTX-2.5-Comfy-GGUF
سوالات متداول
LTX 2.5 چیست؟
LTX 2.5 یک مدل Open Weights از Lightricks برای تولید ویدیو و صدا است که امکان اجرای محلی، استفاده در ComfyUI و Fine-tuning را فراهم میکند.
آیا LTX 2.5 روی ComfyUI اجرا میشود؟
بله. LTX 2.5 بهصورت رسمی Workflowهای Text-to-Video، Image-to-Video و First Frame / Last Frame برای ComfyUI دارد.
آیا LTX 2.5 روی کارت گرافیک 8GB اجرا میشود؟
بله، با نسخههای کمحافظه و Workflowهای بهینهشده میتوان LTX 2.5 را روی کارتهای 8GB اجرا کرد. نمونههای عملی اجرای آن روی RTX 4060 و RTX 5060 Laptop با 8GB VRAM منتشر شدهاند.
حداقل VRAM رسمی LTX 2.5 چقدر است؟
LTX در صفحه رسمی خود 16GB VRAM را بهعنوان حداقل VRAM در مشخصات مدل اعلام کرده است؛ با این حال نسخههای Quantized و Low-VRAM امکان اجرای مدل با حافظه کمتر را فراهم کردهاند.
آیا برای LTX 2.5 نسخه GGUF وجود دارد؟
بله. چند نسخه GGUF توسط جامعه منتشر شدهاند که برای اجرای Quantized مدل در ابزارهایی مانند ComfyUI قابل استفاده هستند.
LTX 2.5 را از کجا دانلود کنیم؟
نسخه اصلی را میتوانید از مخزن رسمی Lightricks در Hugging Face دریافت کنید:
برای نسخههای GGUF نیز مخازن جداگانهای در Hugging Face وجود دارد.
آیا LTX 2.5 رایگان است؟
وزنهای مدل برای اجرای محلی در دسترس هستند، اما استفاده از مدل تابع شرایط مجوز LTX-2.x است. برای استفاده تجاری باید متن مجوز فعلی را بررسی کنید.