مدل جهان چیست؟ تفاوت World Model با LLM و مدل تولید ویدئو
مدل جهان نمایش پویایی از یک محیط میسازد و پیشبینی میکند هر اقدام چگونه وضعیت آن را تغییر میدهد. در این راهنما با نحوه کار، کاربردها و تفاوت World Model با LLM، مدل ویدئو و شبیهساز آشنا میشوید.
مدل جهان یا World Model نوعی سیستم هوش مصنوعی است که تلاش میکند نمایش داخلی و قابلاستفادهای از یک محیط بسازد و پیشبینی کند وضعیت آن محیط در طول زمان یا در نتیجه یک اقدام چگونه تغییر خواهد کرد.
یک مدل جهان فقط به این سؤال پاسخ نمیدهد که «در تصویر چه چیزی وجود دارد؟» بلکه میخواهد بفهمد:
- اشیا کجا قرار گرفتهاند؟
- چگونه حرکت میکنند؟
- چه رابطهای با یکدیگر دارند؟
- محیط در لحظه بعد چه وضعیتی خواهد داشت؟
- اگر عامل اقدامی انجام دهد چه تغییری ایجاد میشود؟
- برای رسیدن به یک هدف، چه اقداماتی باید انتخاب شوند؟
برای مثال، یک ربات باید بتواند تشخیص دهد اگر لیوان را از کنار هل دهد، احتمالاً جابهجا میشود؛ اگر مانعی میان ربات و هدف باشد، باید مسیر دیگری انتخاب کند؛ و اگر وضعیت محیط تغییر کند، برنامه قبلی ممکن است دیگر مناسب نباشد.
براساس تعریف NVIDIA از World Model، مدلهای جهان برای درک پویایی، ویژگیهای فضایی و تغییرات محیط طراحی میشوند و میتوانند با استفاده از متن، تصویر، ویدئو، صدا و حرکت، وضعیت بعدی را پیشبینی کنند.
مدلهای جهان یکی از مهمترین مسیرهای جدید هوش مصنوعی در سال ۲۰۲۶ محسوب میشوند؛ زیرا توسعه هوش مصنوعی در حال حرکت از «درک و تولید محتوا» به سمت «درک محیط، پیشبینی پیامد و تعامل» است.
مدل جهان به زبان ساده چیست؟
انسانها دائماً از یک مدل ذهنی سادهشده از جهان استفاده میکنند.
وقتی میخواهید کتابی را از روی میز بردارید، پیش از انجام حرکت میتوانید نتیجه احتمالی چند اقدام را تصور کنید:
- اگر دست را مستقیم حرکت دهید، به لیوان برخورد میکند.
- اگر از سمت راست نزدیک شوید، مسیر باز است.
- اگر کتاب زیر وسیله دیگری باشد، ابتدا باید آن وسیله را جابهجا کنید.
- اگر کتاب سنگین باشد، باید نیروی بیشتری وارد کنید.
شما لازم نیست تمام این حالتها را در دنیای واقعی آزمایش کنید. بخشی از آنها را در ذهن پیشبینی میکنید و سپس اقدام مناسبتر را انتخاب میکنید.
یک World Model نیز میکوشد چنین قابلیتهایی را بهصورت محاسباتی ایجاد کند:
وضعیت فعلی محیط
+
اقدام احتمالی
↓
پیشبینی وضعیت بعدی
عامل هوش مصنوعی میتواند چند اقدام را در مدل جهان آزمایش کند و قبل از اجرای واقعی، نتیجه احتمالی هرکدام را بسنجد.
چرا مدلهای جهان مهم شدهاند؟
مدلهای زبانی در درک و تولید متن پیشرفت زیادی کردهاند، اما جهان فقط از کلمات تشکیل نشده است.
محیط واقعی شامل این عناصر است:
- فضا
- زمان
- حرکت
- فاصله
- جهت
- عمق
- نیرو
- تعامل اشیا
- تغییر وضعیت
- رابطه علت و معلولی
- پیامد اقدامات
مدل زبانی میتواند درباره افتادن یک توپ توضیح دهد، اما این توانایی الزاماً به معنی داشتن نمایش دقیق و پایدار از مسیر حرکت توپ در یک محیط سهبعدی نیست.
مدل جهان برای پرکردن همین فاصله توسعه پیدا میکند: حرکت از دانش زبانی به سمت درک فضایی، زمانی و عملیاتی.
World Labs در طبقهبندی مدلهای جهان توضیح میدهد که مدل زبانی ساختار آماری متن را یاد میگیرد، درحالیکه World Model باید ساختار فضا و زمان و نحوه تغییر محیط را یاد بگیرد.
هوش فضایی چیست؟
هوش فضایی یا Spatial Intelligence به توانایی درک و استدلال درباره فضا، موقعیت اشیا، زاویه دید، حرکت و رابطه میان اجزای محیط گفته میشود.
یک سیستم دارای هوش فضایی باید بتواند:
- موقعیت نسبی اشیا را تشخیص دهد.
- محیط را از زاویههای مختلف تصور کند.
- ساختار سهبعدی را از تصاویر دوبعدی استنباط کند.
- حرکت در فضا را دنبال کند.
- تغییرات محیط را در طول زمان حفظ کند.
- مسیر مناسب برای رسیدن به هدف را پیدا کند.
- اثر جابهجایی یا تعامل با اشیا را پیشبینی کند.
مدلهای جهان یکی از مسیرهای اصلی توسعه هوش فضایی هستند، اما هر سیستم دارای قابلیت فضایی الزاماً World Model کامل نیست.
مدل جهان چگونه کار میکند؟
معماری دقیق مدلهای جهان یکسان نیست، اما یک سیستم کامل میتواند از چند بخش تشکیل شود.
دریافت مشاهده
سیستم ابتدا اطلاعاتی درباره محیط دریافت میکند. این اطلاعات میتوانند شامل موارد زیر باشند:
- تصویر دوربین
- ویدئو
- نقشه عمق
- صدا
- داده حسگر
- متن
- وضعیت اشیا
- موقعیت عامل
- اقدامات قبلی
این دادهها مشاهده یا Observation نامیده میشوند.
تبدیل محیط به نمایش داخلی
داده خام معمولاً بسیار حجیم است. مدل آن را به نمایش فشردهتری تبدیل میکند که ویژگیهای مهم محیط را نگه میدارد.
این نمایش میتواند شامل اطلاعاتی مانند این موارد باشد:
- اشیای موجود
- موقعیت آنها
- جهت حرکت
- وضعیت فعلی
- رابطه میان اشیا
- ویژگیهای مؤثر در ادامه رویداد
نمایش داخلی گاهی در فضای Latent یا نهفته نگهداری میشود. در این حالت، مدل الزاماً تمام پیکسلهای صحنه را بازسازی نمیکند؛ بلکه ویژگیهای لازم برای پیشبینی و برنامهریزی را حفظ میکند.
پیشبینی تغییرات
بخش Dynamics یا Transition Model پیشبینی میکند محیط چگونه تغییر خواهد کرد.
دو حالت اصلی وجود دارد:
وضعیت فعلی
→ وضعیت احتمالی بعدی
یا:
وضعیت فعلی
+
اقدام عامل
→ وضعیت احتمالی بعدی
حالت دوم برای رباتیک، بازی و عاملهای تعاملی اهمیت بیشتری دارد؛ زیرا مدل باید پیامد یک اقدام مشخص را پیشبینی کند.
تولید یا بازسازی خروجی
بعضی World Modelها وضعیت پیشبینیشده را به تصویر، ویدئو یا محیط سهبعدی قابلمشاهده تبدیل میکنند.
برخی دیگر فقط در فضای نهفته کار میکنند و نیازی به تولید تصویر واقعی ندارند. اگر هدف انتخاب اقدام مناسب باشد، پیشبینی یک نمایش فشرده میتواند کافی باشد.
برنامهریزی
Planner چند اقدام احتمالی را با استفاده از مدل جهان بررسی میکند:
- اقدام اول چه نتیجهای دارد؟
- پس از آن چه اقدامهایی ممکناند؟
- کدام مسیر به هدف نزدیکتر میشود؟
- کدام اقدام باعث دورشدن از هدف میشود؟
- بعد از مشاهده نتیجه واقعی، آیا برنامه باید اصلاح شود؟
در این معماری، مدل جهان پیامدها را پیشبینی میکند و Planner از این پیشبینیها برای انتخاب مسیر استفاده میکند.
سه قابلیت اصلی World Model
یک مدل جهان کاربردی معمولاً باید سه توانایی اصلی داشته باشد.
درک محیط
مدل باید اشیا، حرکتها، روابط و وضعیت فعلی را از ورودی استخراج کند.
پیشبینی
مدل باید بتواند حدس بزند محیط در ادامه چه تغییری خواهد کرد یا یک اقدام چه پیامدی دارد.
برنامهریزی
پیشبینی باید برای انتخاب اقدام مفید باشد. مدلی که فقط فریم بعدی را تولید میکند اما نتوان از آن برای تصمیمگیری استفاده کرد، الزاماً World Model کامل و کاربردی محسوب نمیشود.
Meta در معرفی V-JEPA 2 نیز سه قابلیت Understanding، Predicting و Planning را از اهداف مهم مدل جهان معرفی میکند.
تفاوت World Model و مدل زبانی بزرگ
مدل زبانی بزرگ یا LLM بیشتر ساختار زبان، متن و کد را یاد میگیرد. World Model بر نمایش و تغییرات یک محیط تمرکز دارد.
| ویژگی | مدل زبانی بزرگ | مدل جهان |
|---|---|---|
| داده اصلی | متن و کد، گاهی داده چندوجهی | تصویر، ویدئو، حرکت، اقدام و حسگر |
| واحد مهم | توکن | وضعیت، مشاهده و اقدام |
| هدف رایج | تولید یا تحلیل زبان | پیشبینی تغییرات محیط |
| درک فضا | محدود یا وابسته به داده | یکی از قابلیتهای اصلی |
| درک زمان | بیشتر در قالب توالی | تغییر وضعیت واقعی یا شبیهسازیشده |
| نقش اقدام | معمولاً دستور یا Tool Call | ورودی مستقیم برای پیشبینی پیامد |
| خروجی | متن، کد یا داده ساختاریافته | وضعیت بعدی، مسیر، ویدئو یا محیط |
| کاربرد | چت، تولید محتوا، برنامهنویسی | رباتیک، شبیهسازی و محیط تعاملی |
این دو فناوری میتوانند کنار یکدیگر استفاده شوند.
مدل زبانی میتواند هدف کاربر را بفهمد و آن را به برنامه سطح بالا تبدیل کند. World Model پیامد اقدامهای فیزیکی یا فضایی را پیشبینی میکند. کنترلکننده نیز اقدام نهایی را اجرا میکند.
تفاوت World Model و مدل چندوجهی
مدل چندوجهی میتواند چند نوع داده مانند متن، تصویر، صدا یا ویدئو را پردازش کند.
اما چندوجهیبودن بهتنهایی به معنی داشتن مدل جهان نیست.
یک مدل چندوجهی ممکن است:
- تصویر را توضیح دهد.
- به سؤال درباره ویدئو پاسخ دهد.
- متن داخل عکس را بخواند.
- اشیا را شناسایی کند.
- چند تصویر را مقایسه کند.
World Model علاوه بر مشاهده محیط باید بتواند تغییر آن را در طول زمان یا بر اثر اقدام پیشبینی کند.
بنابراین:
چندوجهیبودن
≠
مدل جهان بودن
بسیاری از مدلهای جهان چندوجهی هستند، اما هر مدل چندوجهی یک World Model نیست.
راهنمای هوش مصنوعی چندوجهی چیست؟ این مفهوم را با جزئیات بیشتری بررسی میکند.
تفاوت مدل جهان و مدل تولید ویدئو
این دو فناوری میتوانند خروجی ظاهراً مشابه تولید کنند، اما هدف آنها متفاوت است.
مدل تولید ویدئو معمولاً تلاش میکند براساس متن یا تصویر، کلیپی طبیعی و جذاب بسازد.
World Model باید وضعیت محیط را با توجه به اقدامها حفظ و تغییرات آن را پیشبینی کند.
| ویژگی | مدل تولید ویدئو | مدل جهان |
|---|---|---|
| هدف | ساخت ویدئو | شبیهسازی تغییر محیط |
| تعامل کاربر | معمولاً پرامپت اولیه | اقدام پیوسته در محیط |
| تداوم وضعیت | برای کیفیت ویدئو | برای عملکرد مدل ضروری |
| پاسخ به اقدام | محدود یا غیرتعاملی | قابلیت مرکزی |
| برنامهریزی عامل | هدف اصلی نیست | یکی از کاربردهای مهم |
| خروجی | کلیپ | محیط، وضعیت یا پیشبینی |
| معیار اصلی | کیفیت بصری و هماهنگی | سازگاری، پیشبینی و قابلیت کنترل |
یک ویدئوی زیبا ممکن است از نظر فیزیکی ناسازگار باشد. برای مدل تولید محتوا، کیفیت بصری میتواند مهمترین معیار باشد؛ اما برای World Model، تغییرات غیرمنطقی محیط یک ضعف اساسی محسوب میشوند.
تفاوت World Model و موتور بازی
موتور بازی مانند Unreal Engine یا Godot محیط را براساس قواعدی اجرا میکند که برنامهنویس تعریف کرده است.
برای مثال، موتور بازی میداند:
- نیروی جاذبه چقدر است.
- اشیا چگونه برخورد میکنند.
- شخصیت با چه سرعتی حرکت میکند.
- چه عملی مجاز است.
- وضعیت بازی چگونه ذخیره میشود.
World Model تلاش میکند بخشی از این روابط را از داده یاد بگیرد.
| ویژگی | موتور بازی | World Model |
|---|---|---|
| قواعد | توسط توسعهدهنده تعریف میشوند | از داده یاد گرفته میشوند |
| رفتار | قابلپیشبینیتر | احتمالی |
| هدف | اجرای محیط طراحیشده | پیشبینی یا تولید محیط |
| تغییر دامنه | نیازمند برنامهنویسی | میتواند از داده تطبیق پیدا کند |
| خروجی | محیط دقیق براساس قواعد | محیط یا وضعیت پیشبینیشده |
| مناسب برای | ساخت بازی و شبیهساز قطعی | آموزش، پیشبینی و تعامل هوشمند |
معماری ترکیبی میتواند World Model را کنار موتور بازی قرار دهد. موتور، قوانین قطعی را اجرا میکند و مدل، محیط یا رفتارهای پیچیدهتر را پیشبینی میکند.
تفاوت مدل جهان و Digital Twin
Digital Twin یا دوقلوی دیجیتال نسخه دیجیتالی یک دارایی، سیستم یا فرایند مشخص است؛ مانند خط تولید، ساختمان یا ماشین صنعتی.
مدل جهان مفهوم گستردهتری دارد و ممکن است برای محیطهای متعدد آموزش دیده باشد.
دوقلوی دیجیتال معمولاً:
- به یک سیستم واقعی مشخص متصل است.
- وضعیت همان سیستم را نمایش میدهد.
- از داده عملیاتی آن استفاده میکند.
- برای تحلیل و شبیهسازی همان دارایی طراحی میشود.
World Model میتواند بخشی از یک Digital Twin هوشمند باشد، اما این دو اصطلاح مترادف نیستند.
انواع مدل جهان
مدل جهان نهفته
این مدل بهجای تولید تمام پیکسلهای آینده، نمایش فشردهای از وضعیت بعدی را پیشبینی میکند.
مزیت آن تمرکز روی اطلاعات مهم و کاهش محاسبات غیرضروری است.
معماری JEPA نمونهای از این رویکرد است. Meta توضیح میدهد که V-JEPA بخشهای پنهان ویدئو را در فضای نمایش انتزاعی پیشبینی میکند، نه اینکه تمام پیکسلها را بازسازی کند.
مدل جهان مولد
این مدل میتواند محیط یا وضعیت آینده را بهشکل قابلمشاهده تولید کند:
- تصویر
- ویدئو
- صحنه سهبعدی
- محیط قابلکاوش
این دسته برای تولید محیط، شبیهسازی و آموزش عاملها کاربرد دارد.
مدل جهان شرطیشده با اقدام
در این مدل، Action بخشی از ورودی است:
اگر عامل به سمت چپ حرکت کند،
محیط از زاویه جدید چگونه دیده خواهد شد؟
این قابلیت برای برنامهریزی اهمیت دارد، زیرا عامل باید پیامد اقدامات مختلف را مقایسه کند.
مدل جهان تخصصی
مدل میتواند برای یک حوزه مشخص توسعه داده شود:
- انبار
- کارخانه
- رانندگی
- رباتیک
- بازی
- طراحی سهبعدی
- لجستیک
- محیط شهری
مدل تخصصی معمولاً نسبت به مدل عمومی دامنه محدودتری دارد، اما میتواند روابط همان محیط را دقیقتر بازنمایی کند.
مدل ترکیبی
در معماری ترکیبی، چند جزء کنار هم قرار میگیرند:
- مدل بینایی برای درک تصویر
- World Model برای پیشبینی
- شبیهساز برای اجرای قواعد قطعی
- مدل زبانی برای درک هدف
- Planner برای انتخاب اقدام
- کنترلکننده برای اجرا
بسیاری از محصولات آینده احتمالاً بهجای یک مدل واحد از چنین معماریای استفاده میکنند.
نمونههای مهم World Model
Genie 3
Genie 3 گوگل دیپمایند یک مدل جهان عمومی است که میتواند محیطهای تعاملی متنوعی تولید کند.
تفاوت مهم آن با ویدئوی معمولی این است که کاربر یا عامل میتواند در محیط حرکت کند و وضعیت جدید براساس اقدام ایجاد شود.
در سال ۲۰۲۶، Project Genie امکان آزمایش محیطهای تعاملی ساختهشده با این فناوری را برای گروههایی از کاربران فراهم کرد. دسترسی عمومی و شرایط استفاده آن به کشور، حساب و برنامه عرضه گوگل وابسته است؛ بنابراین در این مقاله بهعنوان نمونه پژوهشی معرفی میشود، نه ابزار تضمینشده برای بازار ایران.
V-JEPA 2
V-JEPA 2 مدل جهان ویدئویی Meta است که برای درک، پیشبینی و برنامهریزی در محیط فیزیکی توسعه یافته است.
براساس توضیحات رسمی Meta، مدل ابتدا از حجم زیادی تصویر و ویدئو ساختارهای محیط را یاد میگیرد و سپس با داده شامل Action برای برنامهریزی ربات آماده میشود.
کد، مدل و منابع پژوهشی V-JEPA 2 منتشر شدهاند و پژوهشگران میتوانند آن را در محیط خود بررسی کنند.
Marble
Marble مدل جهان چندوجهی World Labs برای ساخت محیطهای سهبعدی قابلکاوش از متن، تصویر و ویدئو است.
World Labs در سال ۲۰۲۶ یک World API برای تولید محیطهای قابلکاوش معرفی کرد. این API مستقل از درواره است و دسترسی، پرداخت و محدودیتهای جغرافیایی آن باید مستقیماً در مستندات همان سرویس بررسی شوند.
کاربرد مدلهای جهان
رباتیک
ربات باید پیش از حرکت، نتیجه احتمالی اقدام را پیشبینی کند.
World Model میتواند برای این وظایف مفید باشد:
- گرفتن و جابهجاکردن اشیا
- حرکت در محیط ناآشنا
- انتخاب مسیر
- پیشبینی حرکت اشیا
- تطبیق با تغییرات محیط
- تقسیم هدف به زیرهدفهای فضایی
- تمرین در شبیهسازی
آموزش Agentها در محیط شبیهسازیشده
عامل هوش مصنوعی میتواند هزاران سناریو را در محیط مجازی تجربه کند:
- مشاهده وضعیت
- انتخاب اقدام
- دریافت نتیجه
- اصلاح راهبرد
- تکرار سناریو
این روش امکان تولید تجربه آموزشی بیشتری را بدون اجرای تمام حالتها در محیط واقعی فراهم میکند.
رانندگی و حملونقل
مدل جهان میتواند برای ساخت سناریوهایی استفاده شود که ثبت آنها در داده واقعی دشوار یا بسیار کمتکرار است.
Waymo World Model نمونهای تخصصی است که بر پایه Genie 3 برای شبیهسازی شرایط رانندگی توسعه یافته است.
بازی و محیط تعاملی
مدلهای جهان میتوانند در آینده برای این کاربردها استفاده شوند:
- ساخت محیط از توضیح متنی
- تولید مرحلههای قابلکاوش
- ایجاد جهان واکنشپذیر
- آموزش شخصیتهای هوشمند
- نمونهسازی سریع ایده بازی
- ایجاد سناریوهای پویا
- تولید محیط تمرینی برای Agent
این مدلها هنوز جایگزین کامل موتور بازی نیستند. موتور بازی همچنان برای منطق قطعی، رابط، فیزیک قابلکنترل و مدیریت وضعیت کاربرد دارد.
طراحی سهبعدی
طراح میتواند از متن، تصویر یا طرح اولیه برای ساخت فضای سهبعدی قابلکاوش استفاده کند.
کاربردهای احتمالی:
- پیشنمایش محیط
- طراحی صحنه
- معماری مفهومی
- تولید فضای مجازی
- گردش مجازی
- پیشتولید فیلم و انیمیشن
- طراحی تجربه تعاملی
شبیهسازی صنعتی
مدل جهان میتواند کنار شبیهسازهای تخصصی برای بررسی سناریوهای عملیاتی استفاده شود:
- چیدمان تجهیزات
- حرکت رباتهای انبار
- جریان مواد
- زمانبندی عملیات
- تغییر وضعیت خط تولید
- مقایسه مسیرهای اجرایی
برای محاسبات قطعی، همچنان باید از مدلها و نرمافزارهای تخصصی همان صنعت استفاده شود.
رابطه داده مصنوعی و World Model
مدلهای جهان میتوانند هم مصرفکننده و هم تولیدکننده داده مصنوعی باشند.
استفاده از داده مصنوعی برای آموزش
محیط شبیهسازی میتواند سناریوهای متنوعی برای آموزش مدل ایجاد کند:
- نورهای متفاوت
- زاویههای مختلف
- چیدمانهای گوناگون
- حرکتهای متفاوت
- شرایط کمتکرار
- وضعیتهای شروع متنوع
تولید داده با World Model
مدل جهان نیز میتواند محیط، ویدئو، مسیر حرکت یا نتیجه اقدامات را تولید کند. این خروجیها برای آموزش و ارزیابی عاملها استفاده میشوند.
برای آشنایی بیشتر با این مفهوم، مقاله داده مصنوعی چیست؟ را بخوانید.
مدل جهان چگونه آموزش داده میشود؟
جمعآوری داده چندوجهی
داده آموزشی میتواند شامل این موارد باشد:
- تصویر
- ویدئو
- صدا
- نقشه عمق
- حرکت
- موقعیت
- وضعیت محیط
- اقدام عامل
- نتیجه اقدام
فقط مشاهده ویدئو میتواند به مدل در یادگیری حرکت و روابط کمک کند، اما برای پیشبینی نتیجه یک Action به دادهای نیاز است که ارتباط میان اقدام و تغییر محیط را نشان دهد.
یادگیری خودنظارتی
در این روش، بخشی از داده پنهان میشود و مدل تلاش میکند نمایش آن را از Context پیشبینی کند.
مزیت این روش، استفاده از حجم زیادی ویدئو بدون برچسبگذاری دستی تمام فریمهاست.
یادگیری پویایی محیط
مدل باید ارتباط میان وضعیتهای متوالی را یاد بگیرد:
قبل از اقدام
→ اقدام
→ بعد از اقدام
این ارتباط پایه برنامهریزی و کنترل است.
آموزش تخصصی
پس از یادگیری عمومی، مدل میتواند با داده یک محیط مشخص برای کاربرد تخصصی آماده شود.
برای مثال، مدل عمومی ممکن است حرکت و اشیای مختلف را بشناسد؛ اما برای کار در یک انبار به داده مربوط به قفسه، بسته، مسیر و تجهیزات همان حوزه نیاز دارد.
چگونه World Model ارزیابی میشود؟
کیفیت بصری بهتنهایی کافی نیست. یک مدل جهان باید از چند جهت ارزیابی شود.
سازگاری زمانی
آیا محیط در طول زمان پایدار میماند یا اشیا بیدلیل تغییر میکنند؟
سازگاری فضایی
آیا موقعیت، اندازه و رابطه میان اشیا هنگام تغییر زاویه حفظ میشود؟
سازگاری با اقدام
آیا نتیجه تولیدشده با Action عامل هماهنگ است؟
پیشبینی فیزیکی
آیا حرکتها و برخوردها با قواعد مورد انتظار محیط سازگارند؟
حافظه محیط
آیا مدل وضعیت قبلی را هنگام بازگشت عامل به یک بخش از محیط حفظ میکند؟
قابلیت برنامهریزی
آیا پیشبینی مدل واقعاً به عامل کمک میکند مسیر مناسبتری انتخاب کند؟
انتقال به محیط جدید
آیا مدل در صحنه، شیء یا ترکیبی که دقیقاً در آموزش ندیده عملکرد قابلقبولی دارد؟
ارزش در وظیفه واقعی
مهمترین سؤال این است که آیا World Model نرخ موفقیت سیستم نهایی را بهتر میکند یا خیر.
محدودیتهای مدلهای جهان
حفظ وضعیت در بازه طولانی
ممکن است محیط در چند ثانیه یا چند دقیقه سازگار باشد، اما در تعامل طولانی تغییرات غیرمنطقی ایجاد شود.
شبیهسازی ناقص فیزیک
ظاهر طبیعی یک صحنه تضمین نمیکند روابط فیزیکی آن درست باشند.
هزینه محاسباتی
تولید ویدئو یا محیط تعاملی در زمان واقعی به منابع محاسباتی زیادی نیاز دارد.
کمبود داده شامل اقدام
ویدئوهای اینترنتی حرکت را نشان میدهند، اما معمولاً مشخص نمیکنند عامل دقیقاً چه Action کنترلی انجام داده است. داده رباتیک شامل مشاهده و اقدام محدودتر است.
پیشبینی چند آینده ممکن
از یک وضعیت ممکن است چند نتیجه منطقی ایجاد شود. مدل باید عدم قطعیت و چند مسیر ممکن را مدیریت کند.
فاصله شبیهسازی و محیط واقعی
مدلی که در شبیهسازی خوب عمل میکند، لزوماً در محیط واقعی همان نتیجه را ندارد. عملکرد باید در شرایط نهایی نیز ارزیابی شود.
آیا مدل جهان جایگزین LLM میشود؟
احتمالاً خیر. این دو مدل وظایف متفاوتی دارند.
یک معماری آینده میتواند چنین باشد:
مدل زبانی
→ درک هدف و دستور کاربر
مدل جهان
→ پیشبینی تغییرات محیط
Planner
→ انتخاب اقدام
ابزار یا کنترلکننده
→ اجرای اقدام
مدل چندوجهی
→ تحلیل نتیجه
مدل زبانی
→ توضیح خروجی برای کاربر
مدل زبانی رابط معنایی و زبانی سیستم است. World Model لایه درک پویایی محیط را ایجاد میکند. کنار هم قرارگرفتن آنها میتواند عاملهایی بسازد که هم دستور را میفهمند و هم پیامد اقدام را پیشبینی میکنند.
نقش API در معماری مبتنی بر World Model
تمام World Modelها از طریق API عمومی در دسترس نیستند. بعضی فقط پروژه پژوهشی، مدل متنباز یا قابلیت محدود آزمایشی هستند.
یک سامانه مبتنی بر World Model ممکن است از چند API و جزء جداگانه استفاده کند:
- API مدل زبانی
- مدل چندوجهی
- مدل تولید تصویر یا ویدئو
- World Model
- موتور شبیهسازی
- پایگاه داده وضعیت
- ابزارهای کنترل
- سیستم ارزیابی
درواره میتواند لایه دسترسی به مدلهای زبانی، استدلالی و چندوجهی موجود در کاتالوگ خود را فراهم کند. اما نباید هر مدل ویدئویی یا چندوجهی درواره را World Model تلقی کرد.
پیش از طراحی باید قابلیت دقیق هر مدل را در کاتالوگ جاری بررسی کنید.
استفاده از API درواره کنار مدل جهان
فرض کنید World Model یا شبیهساز، وضعیت زیر را تولید کرده است:
{
"goal": "انتقال بسته به ایستگاه دوم",
"current_state": {
"robot_position": "A3",
"package_position": "B2",
"target_position": "D5"
},
"available_actions": [
"move_left",
"move_right",
"move_forward",
"pick_package",
"place_package"
],
"predicted_paths": [
{
"path_id": "p1",
"steps": 9,
"result": "goal_reached"
},
{
"path_id": "p2",
"steps": 7,
"result": "blocked_at_D3"
}
]
}
یک مدل زبانی میتواند این خروجی را به گزارش فارسی یا برنامه سطح بالا تبدیل کند. اما نباید جای World Model، شبیهساز یا کنترلکننده را بگیرد.
نمونه اتصال با Python:
import json
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1"
)
model_id = os.environ["DARVAREH_MODEL"]
world_state = {
"goal": "انتقال بسته به ایستگاه دوم",
"current_state": {
"robot_position": "A3",
"package_position": "B2",
"target_position": "D5"
},
"predicted_paths": [
{
"path_id": "p1",
"steps": 9,
"result": "goal_reached"
},
{
"path_id": "p2",
"steps": 7,
"result": "blocked_at_D3"
}
]
}
response = client.chat.completions.create(
model=model_id,
messages=[
{
"role": "system",
"content": """
شما دستیار توضیح نتایج شبیهسازی هستید.
فقط براساس داده ورودی پاسخ بده.
نتیجه جدیدی شبیهسازی نکن.
مسیر قابلاجرا را معرفی کن و دلیل رد مسیر دیگر را کوتاه بنویس.
"""
},
{
"role": "user",
"content": json.dumps(
world_state,
ensure_ascii=False
)
}
],
temperature=0.1
)
print(response.choices[0].message.content)
در این معماری:
- World Model مسیرها را پیشبینی میکند.
- شبیهساز نتیجه را بررسی میکند.
- Backend قواعد را اعمال میکند.
- مدل متصل به API درواره نتیجه را توضیح میدهد.
- کنترلکننده اقدام تأییدشده را اجرا میکند.
کاربردهای API درواره کنار World Model
تبدیل هدف زبان طبیعی به سناریوی ساختاریافته
کاربر مینویسد:
ربات باید بسته را بدون ورود به مسیر مسدود به ایستگاه دوم برساند.
مدل زبانی میتواند این هدف را به JSON شامل هدف، محدودیت و معیار پایان تبدیل کند.
تولید سناریوی شبیهسازی
مدل میتواند سناریوهای متنی متنوعی برای آموزش یا ارزیابی پیشنهاد دهد. اجرای سناریو باید توسط شبیهساز انجام شود.
توضیح نتیجه
خروجی عددی یا ساختاریافته شبیهساز میتواند به گزارش فارسی قابلفهم تبدیل شود.
ساخت Planner سطح بالا
مدل استدلالی میتواند هدف را به چند زیرهدف تبدیل کند. World Model سپس درباره اقدامهای محیطی پیشبینی انجام میدهد.
تحلیل تصویر یا ویدئو
اگر مدل چندوجهی انتخابشده از ورودی موردنظر پشتیبانی کند، میتوان از آن برای استخراج توضیح صحنه یا ساخت Context استفاده کرد.
تولید داده مصنوعی
مدلهای زبانی و مولد میتوانند در ساخت توضیحات، سناریوها، برچسبها و نمونههای آموزشی کنار World Model قرار گیرند.
آیا میتوان امروز World Model ساخت؟
ساخت یک World Foundation Model عمومی به داده و زیرساخت محاسباتی گسترده نیاز دارد و برای بیشتر تیمها پروژه واقعبینانهای نیست.
اما میتوان یک مدل جهان محدود و تخصصی ساخت.
مسیر عملیتر:
- محیط محدود را تعریف کنید.
- وضعیتها و Actionهای مجاز را مشخص کنید.
- داده مشاهده، اقدام و نتیجه جمعآوری کنید.
- یک شبیهساز پایه بسازید.
- مدل پیشبینی وضعیت بعدی را آموزش دهید.
- Planner را روی مدل آزمایش کنید.
- خروجی را در محیط واقعی یا مرجع مقایسه کنید.
- مدل زبانی را فقط برای فهم هدف و توضیح نتیجه اضافه کنید.
برای نمونه اولیه حتی میتوان World Model یادگرفتهشده را با یک Transition Model قاعدهمحور جایگزین کرد و معماری محصول را پیش از آموزش مدل پیچیده آزمایش کرد.
پرسشهای متداول
مدل جهان به زبان ساده چیست؟
مدل جهان سیستمی است که نمایش داخلی از یک محیط میسازد و پیشبینی میکند محیط در طول زمان یا بر اثر اقدام عامل چگونه تغییر خواهد کرد.
World Model چه تفاوتی با LLM دارد؟
LLM بیشتر ساختار زبان و متن را یاد میگیرد. World Model روی فضا، زمان، وضعیت محیط، حرکت و پیامد اقدام تمرکز دارد.
آیا مدل تولید ویدئو همان مدل جهان است؟
خیر. مدل تولید ویدئو برای ساخت کلیپ طراحی میشود. World Model باید وضعیت محیط را حفظ کند و تغییر آن را براساس Action پیشبینی کند.
آیا هر مدل چندوجهی یک World Model است؟
خیر. مدل چندوجهی میتواند متن، تصویر یا ویدئو را پردازش کند، اما World Model باید پویایی محیط و پیامد اقدام را نیز مدلسازی کند.
مدل جهان چه کاربردی دارد؟
رباتیک، شبیهسازی، آموزش Agent، بازی، طراحی سهبعدی، لجستیک، رانندگی و محیطهای تعاملی از کاربردهای مهم آن هستند.
JEPA چیست؟
JEPA معماری پیشبینی در فضای نمایش انتزاعی است. مدل بهجای بازسازی تمام پیکسلها، نمایش بخشهای مهم یا پنهان داده را پیشبینی میکند.
آیا World Model برای کاربران ایرانی در دسترس است؟
وضعیت هر مدل متفاوت است. برخی پروژهها مانند V-JEPA 2 منابع متنباز دارند و برخی سرویسها دارای محدودیت حساب، کشور یا پرداخت هستند. شرایط جاری هر پروژه باید مستقیماً بررسی شود.
آیا درواره World Model ارائه میکند؟
مدلهای چندوجهی یا تولید ویدئو الزاماً World Model نیستند. برای اطمینان باید قابلیتها و مدلهای فعال کاتالوگ درواره بررسی شوند. درواره میتواند لایه مدل زبانی، استدلالی یا چندوجهی معماری شما را فراهم کند.
آیا برای ساخت World Model به LLM نیاز داریم؟
خیر، اما LLM میتواند برای فهم هدف کاربر، تولید سناریو، برنامهریزی سطح بالا و توضیح نتایج در کنار World Model استفاده شود.
جمعبندی
مدل جهان یکی از مسیرهای مهم تکامل هوش مصنوعی از «کار با کلمات و تصاویر» به سمت «درک محیط و پیشبینی پیامد اقدام» است.
World Model تلاش میکند:
- وضعیت محیط را درک کند.
- تغییرات بعدی را پیشبینی کند.
- پیامد Action را تخمین بزند.
- اطلاعات لازم برای برنامهریزی را فراهم کند.
- محیطهای قابلاستفاده برای آموزش Agent ایجاد کند.
این مدل با LLM، مدل چندوجهی، تولیدکننده ویدئو، موتور بازی و Digital Twin یکسان نیست؛ هرچند میتواند با همه آنها ترکیب شود.
در معماری عملی، مدل زبانی هدف را میفهمد، World Model پیامدها را پیشبینی میکند، شبیهساز قواعد قطعی را اجرا میکند و Backend فرایند را مدیریت میکند.
برای افزودن لایه زبانی، استدلالی یا چندوجهی به چنین محصولی میتوانید در درواره ثبتنام کنید، API Key بگیرید و مدل مناسب را از کاتالوگ جاری با یک API یکپارچه آزمایش کنید.
مقالات مرتبط
- هوش مصنوعی چندوجهی چیست؟
- مدل استدلالی چیست؟
- داده مصنوعی چیست؟
- AI Agent و Agent Skills چیست؟
- Computer Use چیست؟
- هوش مصنوعی در Unreal Engine 5
- API هوش مصنوعی چیست؟
منابع
- NVIDIA: What Is a World Model?
- Google DeepMind: Genie 3
- Meta: V-JEPA 2 World Model
- World Labs: A Functional Taxonomy of World Models
- Waymo: The Waymo World Model
این مقاله صرفاً با هدف آموزش و اطلاعرسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویسها و صفحه سلب مسئولیت را مطالعه کنید.