مدل جهان چیست؟ تفاوت World Model با LLM و مدل تولید ویدئو

مدل جهان نمایش پویایی از یک محیط می‌سازد و پیش‌بینی می‌کند هر اقدام چگونه وضعیت آن را تغییر می‌دهد. در این راهنما با نحوه کار، کاربردها و تفاوت World Model با LLM، مدل ویدئو و شبیه‌ساز آشنا می‌شوید.

Share
مدل جهان چیست؟ تفاوت World Model با LLM و مدل تولید ویدئو

مدل جهان یا World Model نوعی سیستم هوش مصنوعی است که تلاش می‌کند نمایش داخلی و قابل‌استفاده‌ای از یک محیط بسازد و پیش‌بینی کند وضعیت آن محیط در طول زمان یا در نتیجه یک اقدام چگونه تغییر خواهد کرد.

یک مدل جهان فقط به این سؤال پاسخ نمی‌دهد که «در تصویر چه چیزی وجود دارد؟» بلکه می‌خواهد بفهمد:

  • اشیا کجا قرار گرفته‌اند؟
  • چگونه حرکت می‌کنند؟
  • چه رابطه‌ای با یکدیگر دارند؟
  • محیط در لحظه بعد چه وضعیتی خواهد داشت؟
  • اگر عامل اقدامی انجام دهد چه تغییری ایجاد می‌شود؟
  • برای رسیدن به یک هدف، چه اقداماتی باید انتخاب شوند؟

برای مثال، یک ربات باید بتواند تشخیص دهد اگر لیوان را از کنار هل دهد، احتمالاً جابه‌جا می‌شود؛ اگر مانعی میان ربات و هدف باشد، باید مسیر دیگری انتخاب کند؛ و اگر وضعیت محیط تغییر کند، برنامه قبلی ممکن است دیگر مناسب نباشد.

براساس تعریف NVIDIA از World Model، مدل‌های جهان برای درک پویایی، ویژگی‌های فضایی و تغییرات محیط طراحی می‌شوند و می‌توانند با استفاده از متن، تصویر، ویدئو، صدا و حرکت، وضعیت بعدی را پیش‌بینی کنند.

مدل‌های جهان یکی از مهم‌ترین مسیرهای جدید هوش مصنوعی در سال ۲۰۲۶ محسوب می‌شوند؛ زیرا توسعه هوش مصنوعی در حال حرکت از «درک و تولید محتوا» به سمت «درک محیط، پیش‌بینی پیامد و تعامل» است.

مدل جهان به زبان ساده چیست؟

انسان‌ها دائماً از یک مدل ذهنی ساده‌شده از جهان استفاده می‌کنند.

وقتی می‌خواهید کتابی را از روی میز بردارید، پیش از انجام حرکت می‌توانید نتیجه احتمالی چند اقدام را تصور کنید:

  • اگر دست را مستقیم حرکت دهید، به لیوان برخورد می‌کند.
  • اگر از سمت راست نزدیک شوید، مسیر باز است.
  • اگر کتاب زیر وسیله دیگری باشد، ابتدا باید آن وسیله را جابه‌جا کنید.
  • اگر کتاب سنگین باشد، باید نیروی بیشتری وارد کنید.

شما لازم نیست تمام این حالت‌ها را در دنیای واقعی آزمایش کنید. بخشی از آن‌ها را در ذهن پیش‌بینی می‌کنید و سپس اقدام مناسب‌تر را انتخاب می‌کنید.

یک World Model نیز می‌کوشد چنین قابلیت‌هایی را به‌صورت محاسباتی ایجاد کند:

وضعیت فعلی محیط
+
اقدام احتمالی
↓
پیش‌بینی وضعیت بعدی

عامل هوش مصنوعی می‌تواند چند اقدام را در مدل جهان آزمایش کند و قبل از اجرای واقعی، نتیجه احتمالی هرکدام را بسنجد.

چرا مدل‌های جهان مهم شده‌اند؟

مدل‌های زبانی در درک و تولید متن پیشرفت زیادی کرده‌اند، اما جهان فقط از کلمات تشکیل نشده است.

محیط واقعی شامل این عناصر است:

  • فضا
  • زمان
  • حرکت
  • فاصله
  • جهت
  • عمق
  • نیرو
  • تعامل اشیا
  • تغییر وضعیت
  • رابطه علت و معلولی
  • پیامد اقدامات

مدل زبانی می‌تواند درباره افتادن یک توپ توضیح دهد، اما این توانایی الزاماً به معنی داشتن نمایش دقیق و پایدار از مسیر حرکت توپ در یک محیط سه‌بعدی نیست.

مدل جهان برای پرکردن همین فاصله توسعه پیدا می‌کند: حرکت از دانش زبانی به سمت درک فضایی، زمانی و عملیاتی.

World Labs در طبقه‌بندی مدل‌های جهان توضیح می‌دهد که مدل زبانی ساختار آماری متن را یاد می‌گیرد، درحالی‌که World Model باید ساختار فضا و زمان و نحوه تغییر محیط را یاد بگیرد.

هوش فضایی چیست؟

هوش فضایی یا Spatial Intelligence به توانایی درک و استدلال درباره فضا، موقعیت اشیا، زاویه دید، حرکت و رابطه میان اجزای محیط گفته می‌شود.

یک سیستم دارای هوش فضایی باید بتواند:

  • موقعیت نسبی اشیا را تشخیص دهد.
  • محیط را از زاویه‌های مختلف تصور کند.
  • ساختار سه‌بعدی را از تصاویر دوبعدی استنباط کند.
  • حرکت در فضا را دنبال کند.
  • تغییرات محیط را در طول زمان حفظ کند.
  • مسیر مناسب برای رسیدن به هدف را پیدا کند.
  • اثر جابه‌جایی یا تعامل با اشیا را پیش‌بینی کند.

مدل‌های جهان یکی از مسیرهای اصلی توسعه هوش فضایی هستند، اما هر سیستم دارای قابلیت فضایی الزاماً World Model کامل نیست.

مدل جهان چگونه کار می‌کند؟

معماری دقیق مدل‌های جهان یکسان نیست، اما یک سیستم کامل می‌تواند از چند بخش تشکیل شود.

دریافت مشاهده

سیستم ابتدا اطلاعاتی درباره محیط دریافت می‌کند. این اطلاعات می‌توانند شامل موارد زیر باشند:

  • تصویر دوربین
  • ویدئو
  • نقشه عمق
  • صدا
  • داده حسگر
  • متن
  • وضعیت اشیا
  • موقعیت عامل
  • اقدامات قبلی

این داده‌ها مشاهده یا Observation نامیده می‌شوند.

تبدیل محیط به نمایش داخلی

داده خام معمولاً بسیار حجیم است. مدل آن را به نمایش فشرده‌تری تبدیل می‌کند که ویژگی‌های مهم محیط را نگه می‌دارد.

این نمایش می‌تواند شامل اطلاعاتی مانند این موارد باشد:

  • اشیای موجود
  • موقعیت آن‌ها
  • جهت حرکت
  • وضعیت فعلی
  • رابطه میان اشیا
  • ویژگی‌های مؤثر در ادامه رویداد

نمایش داخلی گاهی در فضای Latent یا نهفته نگهداری می‌شود. در این حالت، مدل الزاماً تمام پیکسل‌های صحنه را بازسازی نمی‌کند؛ بلکه ویژگی‌های لازم برای پیش‌بینی و برنامه‌ریزی را حفظ می‌کند.

پیش‌بینی تغییرات

بخش Dynamics یا Transition Model پیش‌بینی می‌کند محیط چگونه تغییر خواهد کرد.

دو حالت اصلی وجود دارد:

وضعیت فعلی
→ وضعیت احتمالی بعدی

یا:

وضعیت فعلی
+
اقدام عامل
→ وضعیت احتمالی بعدی

حالت دوم برای رباتیک، بازی و عامل‌های تعاملی اهمیت بیشتری دارد؛ زیرا مدل باید پیامد یک اقدام مشخص را پیش‌بینی کند.

تولید یا بازسازی خروجی

بعضی World Modelها وضعیت پیش‌بینی‌شده را به تصویر، ویدئو یا محیط سه‌بعدی قابل‌مشاهده تبدیل می‌کنند.

برخی دیگر فقط در فضای نهفته کار می‌کنند و نیازی به تولید تصویر واقعی ندارند. اگر هدف انتخاب اقدام مناسب باشد، پیش‌بینی یک نمایش فشرده می‌تواند کافی باشد.

برنامه‌ریزی

Planner چند اقدام احتمالی را با استفاده از مدل جهان بررسی می‌کند:

  1. اقدام اول چه نتیجه‌ای دارد؟
  2. پس از آن چه اقدام‌هایی ممکن‌اند؟
  3. کدام مسیر به هدف نزدیک‌تر می‌شود؟
  4. کدام اقدام باعث دورشدن از هدف می‌شود؟
  5. بعد از مشاهده نتیجه واقعی، آیا برنامه باید اصلاح شود؟

در این معماری، مدل جهان پیامدها را پیش‌بینی می‌کند و Planner از این پیش‌بینی‌ها برای انتخاب مسیر استفاده می‌کند.

سه قابلیت اصلی World Model

یک مدل جهان کاربردی معمولاً باید سه توانایی اصلی داشته باشد.

درک محیط

مدل باید اشیا، حرکت‌ها، روابط و وضعیت فعلی را از ورودی استخراج کند.

پیش‌بینی

مدل باید بتواند حدس بزند محیط در ادامه چه تغییری خواهد کرد یا یک اقدام چه پیامدی دارد.

برنامه‌ریزی

پیش‌بینی باید برای انتخاب اقدام مفید باشد. مدلی که فقط فریم بعدی را تولید می‌کند اما نتوان از آن برای تصمیم‌گیری استفاده کرد، الزاماً World Model کامل و کاربردی محسوب نمی‌شود.

Meta در معرفی V-JEPA 2 نیز سه قابلیت Understanding، Predicting و Planning را از اهداف مهم مدل جهان معرفی می‌کند.

تفاوت World Model و مدل زبانی بزرگ

مدل زبانی بزرگ یا LLM بیشتر ساختار زبان، متن و کد را یاد می‌گیرد. World Model بر نمایش و تغییرات یک محیط تمرکز دارد.

ویژگیمدل زبانی بزرگمدل جهان
داده اصلیمتن و کد، گاهی داده چندوجهیتصویر، ویدئو، حرکت، اقدام و حسگر
واحد مهمتوکنوضعیت، مشاهده و اقدام
هدف رایجتولید یا تحلیل زبانپیش‌بینی تغییرات محیط
درک فضامحدود یا وابسته به دادهیکی از قابلیت‌های اصلی
درک زمانبیشتر در قالب توالیتغییر وضعیت واقعی یا شبیه‌سازی‌شده
نقش اقداممعمولاً دستور یا Tool Callورودی مستقیم برای پیش‌بینی پیامد
خروجیمتن، کد یا داده ساختاریافتهوضعیت بعدی، مسیر، ویدئو یا محیط
کاربردچت، تولید محتوا، برنامه‌نویسیرباتیک، شبیه‌سازی و محیط تعاملی

این دو فناوری می‌توانند کنار یکدیگر استفاده شوند.

مدل زبانی می‌تواند هدف کاربر را بفهمد و آن را به برنامه سطح بالا تبدیل کند. World Model پیامد اقدام‌های فیزیکی یا فضایی را پیش‌بینی می‌کند. کنترل‌کننده نیز اقدام نهایی را اجرا می‌کند.

تفاوت World Model و مدل چندوجهی

مدل چندوجهی می‌تواند چند نوع داده مانند متن، تصویر، صدا یا ویدئو را پردازش کند.

اما چندوجهی‌بودن به‌تنهایی به معنی داشتن مدل جهان نیست.

یک مدل چندوجهی ممکن است:

  • تصویر را توضیح دهد.
  • به سؤال درباره ویدئو پاسخ دهد.
  • متن داخل عکس را بخواند.
  • اشیا را شناسایی کند.
  • چند تصویر را مقایسه کند.

World Model علاوه بر مشاهده محیط باید بتواند تغییر آن را در طول زمان یا بر اثر اقدام پیش‌بینی کند.

بنابراین:

چندوجهی‌بودن
≠
مدل جهان بودن

بسیاری از مدل‌های جهان چندوجهی هستند، اما هر مدل چندوجهی یک World Model نیست.

راهنمای هوش مصنوعی چندوجهی چیست؟ این مفهوم را با جزئیات بیشتری بررسی می‌کند.

تفاوت مدل جهان و مدل تولید ویدئو

این دو فناوری می‌توانند خروجی ظاهراً مشابه تولید کنند، اما هدف آن‌ها متفاوت است.

مدل تولید ویدئو معمولاً تلاش می‌کند براساس متن یا تصویر، کلیپی طبیعی و جذاب بسازد.

World Model باید وضعیت محیط را با توجه به اقدام‌ها حفظ و تغییرات آن را پیش‌بینی کند.

ویژگیمدل تولید ویدئومدل جهان
هدفساخت ویدئوشبیه‌سازی تغییر محیط
تعامل کاربرمعمولاً پرامپت اولیهاقدام پیوسته در محیط
تداوم وضعیتبرای کیفیت ویدئوبرای عملکرد مدل ضروری
پاسخ به اقداممحدود یا غیرتعاملیقابلیت مرکزی
برنامه‌ریزی عاملهدف اصلی نیستیکی از کاربردهای مهم
خروجیکلیپمحیط، وضعیت یا پیش‌بینی
معیار اصلیکیفیت بصری و هماهنگیسازگاری، پیش‌بینی و قابلیت کنترل

یک ویدئوی زیبا ممکن است از نظر فیزیکی ناسازگار باشد. برای مدل تولید محتوا، کیفیت بصری می‌تواند مهم‌ترین معیار باشد؛ اما برای World Model، تغییرات غیرمنطقی محیط یک ضعف اساسی محسوب می‌شوند.

تفاوت World Model و موتور بازی

موتور بازی مانند Unreal Engine یا Godot محیط را براساس قواعدی اجرا می‌کند که برنامه‌نویس تعریف کرده است.

برای مثال، موتور بازی می‌داند:

  • نیروی جاذبه چقدر است.
  • اشیا چگونه برخورد می‌کنند.
  • شخصیت با چه سرعتی حرکت می‌کند.
  • چه عملی مجاز است.
  • وضعیت بازی چگونه ذخیره می‌شود.

World Model تلاش می‌کند بخشی از این روابط را از داده یاد بگیرد.

ویژگیموتور بازیWorld Model
قواعدتوسط توسعه‌دهنده تعریف می‌شونداز داده یاد گرفته می‌شوند
رفتارقابل‌پیش‌بینی‌تراحتمالی
هدفاجرای محیط طراحی‌شدهپیش‌بینی یا تولید محیط
تغییر دامنهنیازمند برنامه‌نویسیمی‌تواند از داده تطبیق پیدا کند
خروجیمحیط دقیق براساس قواعدمحیط یا وضعیت پیش‌بینی‌شده
مناسب برایساخت بازی و شبیه‌ساز قطعیآموزش، پیش‌بینی و تعامل هوشمند

معماری ترکیبی می‌تواند World Model را کنار موتور بازی قرار دهد. موتور، قوانین قطعی را اجرا می‌کند و مدل، محیط یا رفتارهای پیچیده‌تر را پیش‌بینی می‌کند.

تفاوت مدل جهان و Digital Twin

Digital Twin یا دوقلوی دیجیتال نسخه دیجیتالی یک دارایی، سیستم یا فرایند مشخص است؛ مانند خط تولید، ساختمان یا ماشین صنعتی.

مدل جهان مفهوم گسترده‌تری دارد و ممکن است برای محیط‌های متعدد آموزش دیده باشد.

دوقلوی دیجیتال معمولاً:

  • به یک سیستم واقعی مشخص متصل است.
  • وضعیت همان سیستم را نمایش می‌دهد.
  • از داده عملیاتی آن استفاده می‌کند.
  • برای تحلیل و شبیه‌سازی همان دارایی طراحی می‌شود.

World Model می‌تواند بخشی از یک Digital Twin هوشمند باشد، اما این دو اصطلاح مترادف نیستند.

انواع مدل جهان

مدل جهان نهفته

این مدل به‌جای تولید تمام پیکسل‌های آینده، نمایش فشرده‌ای از وضعیت بعدی را پیش‌بینی می‌کند.

مزیت آن تمرکز روی اطلاعات مهم و کاهش محاسبات غیرضروری است.

معماری JEPA نمونه‌ای از این رویکرد است. Meta توضیح می‌دهد که V-JEPA بخش‌های پنهان ویدئو را در فضای نمایش انتزاعی پیش‌بینی می‌کند، نه اینکه تمام پیکسل‌ها را بازسازی کند.

مدل جهان مولد

این مدل می‌تواند محیط یا وضعیت آینده را به‌شکل قابل‌مشاهده تولید کند:

  • تصویر
  • ویدئو
  • صحنه سه‌بعدی
  • محیط قابل‌کاوش

این دسته برای تولید محیط، شبیه‌سازی و آموزش عامل‌ها کاربرد دارد.

مدل جهان شرطی‌شده با اقدام

در این مدل، Action بخشی از ورودی است:

اگر عامل به سمت چپ حرکت کند،
محیط از زاویه جدید چگونه دیده خواهد شد؟

این قابلیت برای برنامه‌ریزی اهمیت دارد، زیرا عامل باید پیامد اقدامات مختلف را مقایسه کند.

مدل جهان تخصصی

مدل می‌تواند برای یک حوزه مشخص توسعه داده شود:

  • انبار
  • کارخانه
  • رانندگی
  • رباتیک
  • بازی
  • طراحی سه‌بعدی
  • لجستیک
  • محیط شهری

مدل تخصصی معمولاً نسبت به مدل عمومی دامنه محدودتری دارد، اما می‌تواند روابط همان محیط را دقیق‌تر بازنمایی کند.

مدل ترکیبی

در معماری ترکیبی، چند جزء کنار هم قرار می‌گیرند:

  • مدل بینایی برای درک تصویر
  • World Model برای پیش‌بینی
  • شبیه‌ساز برای اجرای قواعد قطعی
  • مدل زبانی برای درک هدف
  • Planner برای انتخاب اقدام
  • کنترل‌کننده برای اجرا

بسیاری از محصولات آینده احتمالاً به‌جای یک مدل واحد از چنین معماری‌ای استفاده می‌کنند.

نمونه‌های مهم World Model

Genie 3

Genie 3 گوگل دیپ‌مایند یک مدل جهان عمومی است که می‌تواند محیط‌های تعاملی متنوعی تولید کند.

تفاوت مهم آن با ویدئوی معمولی این است که کاربر یا عامل می‌تواند در محیط حرکت کند و وضعیت جدید براساس اقدام ایجاد شود.

در سال ۲۰۲۶، Project Genie امکان آزمایش محیط‌های تعاملی ساخته‌شده با این فناوری را برای گروه‌هایی از کاربران فراهم کرد. دسترسی عمومی و شرایط استفاده آن به کشور، حساب و برنامه عرضه گوگل وابسته است؛ بنابراین در این مقاله به‌عنوان نمونه پژوهشی معرفی می‌شود، نه ابزار تضمین‌شده برای بازار ایران.

V-JEPA 2

V-JEPA 2 مدل جهان ویدئویی Meta است که برای درک، پیش‌بینی و برنامه‌ریزی در محیط فیزیکی توسعه یافته است.

براساس توضیحات رسمی Meta، مدل ابتدا از حجم زیادی تصویر و ویدئو ساختارهای محیط را یاد می‌گیرد و سپس با داده شامل Action برای برنامه‌ریزی ربات آماده می‌شود.

کد، مدل و منابع پژوهشی V-JEPA 2 منتشر شده‌اند و پژوهشگران می‌توانند آن را در محیط خود بررسی کنند.

Marble

Marble مدل جهان چندوجهی World Labs برای ساخت محیط‌های سه‌بعدی قابل‌کاوش از متن، تصویر و ویدئو است.

World Labs در سال ۲۰۲۶ یک World API برای تولید محیط‌های قابل‌کاوش معرفی کرد. این API مستقل از درواره است و دسترسی، پرداخت و محدودیت‌های جغرافیایی آن باید مستقیماً در مستندات همان سرویس بررسی شوند.

کاربرد مدل‌های جهان

رباتیک

ربات باید پیش از حرکت، نتیجه احتمالی اقدام را پیش‌بینی کند.

World Model می‌تواند برای این وظایف مفید باشد:

  • گرفتن و جابه‌جاکردن اشیا
  • حرکت در محیط ناآشنا
  • انتخاب مسیر
  • پیش‌بینی حرکت اشیا
  • تطبیق با تغییرات محیط
  • تقسیم هدف به زیرهدف‌های فضایی
  • تمرین در شبیه‌سازی

آموزش Agentها در محیط شبیه‌سازی‌شده

عامل هوش مصنوعی می‌تواند هزاران سناریو را در محیط مجازی تجربه کند:

  • مشاهده وضعیت
  • انتخاب اقدام
  • دریافت نتیجه
  • اصلاح راهبرد
  • تکرار سناریو

این روش امکان تولید تجربه آموزشی بیشتری را بدون اجرای تمام حالت‌ها در محیط واقعی فراهم می‌کند.

رانندگی و حمل‌ونقل

مدل جهان می‌تواند برای ساخت سناریوهایی استفاده شود که ثبت آن‌ها در داده واقعی دشوار یا بسیار کم‌تکرار است.

Waymo World Model نمونه‌ای تخصصی است که بر پایه Genie 3 برای شبیه‌سازی شرایط رانندگی توسعه یافته است.

بازی و محیط تعاملی

مدل‌های جهان می‌توانند در آینده برای این کاربردها استفاده شوند:

  • ساخت محیط از توضیح متنی
  • تولید مرحله‌های قابل‌کاوش
  • ایجاد جهان واکنش‌پذیر
  • آموزش شخصیت‌های هوشمند
  • نمونه‌سازی سریع ایده بازی
  • ایجاد سناریوهای پویا
  • تولید محیط تمرینی برای Agent

این مدل‌ها هنوز جایگزین کامل موتور بازی نیستند. موتور بازی همچنان برای منطق قطعی، رابط، فیزیک قابل‌کنترل و مدیریت وضعیت کاربرد دارد.

طراحی سه‌بعدی

طراح می‌تواند از متن، تصویر یا طرح اولیه برای ساخت فضای سه‌بعدی قابل‌کاوش استفاده کند.

کاربردهای احتمالی:

  • پیش‌نمایش محیط
  • طراحی صحنه
  • معماری مفهومی
  • تولید فضای مجازی
  • گردش مجازی
  • پیش‌تولید فیلم و انیمیشن
  • طراحی تجربه تعاملی

شبیه‌سازی صنعتی

مدل جهان می‌تواند کنار شبیه‌سازهای تخصصی برای بررسی سناریوهای عملیاتی استفاده شود:

  • چیدمان تجهیزات
  • حرکت ربات‌های انبار
  • جریان مواد
  • زمان‌بندی عملیات
  • تغییر وضعیت خط تولید
  • مقایسه مسیرهای اجرایی

برای محاسبات قطعی، همچنان باید از مدل‌ها و نرم‌افزارهای تخصصی همان صنعت استفاده شود.

رابطه داده مصنوعی و World Model

مدل‌های جهان می‌توانند هم مصرف‌کننده و هم تولیدکننده داده مصنوعی باشند.

استفاده از داده مصنوعی برای آموزش

محیط شبیه‌سازی می‌تواند سناریوهای متنوعی برای آموزش مدل ایجاد کند:

  • نورهای متفاوت
  • زاویه‌های مختلف
  • چیدمان‌های گوناگون
  • حرکت‌های متفاوت
  • شرایط کم‌تکرار
  • وضعیت‌های شروع متنوع

تولید داده با World Model

مدل جهان نیز می‌تواند محیط، ویدئو، مسیر حرکت یا نتیجه اقدامات را تولید کند. این خروجی‌ها برای آموزش و ارزیابی عامل‌ها استفاده می‌شوند.

برای آشنایی بیشتر با این مفهوم، مقاله داده مصنوعی چیست؟ را بخوانید.

مدل جهان چگونه آموزش داده می‌شود؟

جمع‌آوری داده چندوجهی

داده آموزشی می‌تواند شامل این موارد باشد:

  • تصویر
  • ویدئو
  • صدا
  • نقشه عمق
  • حرکت
  • موقعیت
  • وضعیت محیط
  • اقدام عامل
  • نتیجه اقدام

فقط مشاهده ویدئو می‌تواند به مدل در یادگیری حرکت و روابط کمک کند، اما برای پیش‌بینی نتیجه یک Action به داده‌ای نیاز است که ارتباط میان اقدام و تغییر محیط را نشان دهد.

یادگیری خودنظارتی

در این روش، بخشی از داده پنهان می‌شود و مدل تلاش می‌کند نمایش آن را از Context پیش‌بینی کند.

مزیت این روش، استفاده از حجم زیادی ویدئو بدون برچسب‌گذاری دستی تمام فریم‌هاست.

یادگیری پویایی محیط

مدل باید ارتباط میان وضعیت‌های متوالی را یاد بگیرد:

قبل از اقدام
→ اقدام
→ بعد از اقدام

این ارتباط پایه برنامه‌ریزی و کنترل است.

آموزش تخصصی

پس از یادگیری عمومی، مدل می‌تواند با داده یک محیط مشخص برای کاربرد تخصصی آماده شود.

برای مثال، مدل عمومی ممکن است حرکت و اشیای مختلف را بشناسد؛ اما برای کار در یک انبار به داده مربوط به قفسه، بسته، مسیر و تجهیزات همان حوزه نیاز دارد.

چگونه World Model ارزیابی می‌شود؟

کیفیت بصری به‌تنهایی کافی نیست. یک مدل جهان باید از چند جهت ارزیابی شود.

سازگاری زمانی

آیا محیط در طول زمان پایدار می‌ماند یا اشیا بی‌دلیل تغییر می‌کنند؟

سازگاری فضایی

آیا موقعیت، اندازه و رابطه میان اشیا هنگام تغییر زاویه حفظ می‌شود؟

سازگاری با اقدام

آیا نتیجه تولیدشده با Action عامل هماهنگ است؟

پیش‌بینی فیزیکی

آیا حرکت‌ها و برخوردها با قواعد مورد انتظار محیط سازگارند؟

حافظه محیط

آیا مدل وضعیت قبلی را هنگام بازگشت عامل به یک بخش از محیط حفظ می‌کند؟

قابلیت برنامه‌ریزی

آیا پیش‌بینی مدل واقعاً به عامل کمک می‌کند مسیر مناسب‌تری انتخاب کند؟

انتقال به محیط جدید

آیا مدل در صحنه، شیء یا ترکیبی که دقیقاً در آموزش ندیده عملکرد قابل‌قبولی دارد؟

ارزش در وظیفه واقعی

مهم‌ترین سؤال این است که آیا World Model نرخ موفقیت سیستم نهایی را بهتر می‌کند یا خیر.

محدودیت‌های مدل‌های جهان

حفظ وضعیت در بازه طولانی

ممکن است محیط در چند ثانیه یا چند دقیقه سازگار باشد، اما در تعامل طولانی تغییرات غیرمنطقی ایجاد شود.

شبیه‌سازی ناقص فیزیک

ظاهر طبیعی یک صحنه تضمین نمی‌کند روابط فیزیکی آن درست باشند.

هزینه محاسباتی

تولید ویدئو یا محیط تعاملی در زمان واقعی به منابع محاسباتی زیادی نیاز دارد.

کمبود داده شامل اقدام

ویدئوهای اینترنتی حرکت را نشان می‌دهند، اما معمولاً مشخص نمی‌کنند عامل دقیقاً چه Action کنترلی انجام داده است. داده رباتیک شامل مشاهده و اقدام محدودتر است.

پیش‌بینی چند آینده ممکن

از یک وضعیت ممکن است چند نتیجه منطقی ایجاد شود. مدل باید عدم قطعیت و چند مسیر ممکن را مدیریت کند.

فاصله شبیه‌سازی و محیط واقعی

مدلی که در شبیه‌سازی خوب عمل می‌کند، لزوماً در محیط واقعی همان نتیجه را ندارد. عملکرد باید در شرایط نهایی نیز ارزیابی شود.

آیا مدل جهان جایگزین LLM می‌شود؟

احتمالاً خیر. این دو مدل وظایف متفاوتی دارند.

یک معماری آینده می‌تواند چنین باشد:

مدل زبانی
→ درک هدف و دستور کاربر

مدل جهان
→ پیش‌بینی تغییرات محیط

Planner
→ انتخاب اقدام

ابزار یا کنترل‌کننده
→ اجرای اقدام

مدل چندوجهی
→ تحلیل نتیجه

مدل زبانی
→ توضیح خروجی برای کاربر

مدل زبانی رابط معنایی و زبانی سیستم است. World Model لایه درک پویایی محیط را ایجاد می‌کند. کنار هم قرارگرفتن آن‌ها می‌تواند عامل‌هایی بسازد که هم دستور را می‌فهمند و هم پیامد اقدام را پیش‌بینی می‌کنند.

نقش API در معماری مبتنی بر World Model

تمام World Modelها از طریق API عمومی در دسترس نیستند. بعضی فقط پروژه پژوهشی، مدل متن‌باز یا قابلیت محدود آزمایشی هستند.

یک سامانه مبتنی بر World Model ممکن است از چند API و جزء جداگانه استفاده کند:

  • API مدل زبانی
  • مدل چندوجهی
  • مدل تولید تصویر یا ویدئو
  • World Model
  • موتور شبیه‌سازی
  • پایگاه داده وضعیت
  • ابزارهای کنترل
  • سیستم ارزیابی

درواره می‌تواند لایه دسترسی به مدل‌های زبانی، استدلالی و چندوجهی موجود در کاتالوگ خود را فراهم کند. اما نباید هر مدل ویدئویی یا چندوجهی درواره را World Model تلقی کرد.

پیش از طراحی باید قابلیت دقیق هر مدل را در کاتالوگ جاری بررسی کنید.

استفاده از API درواره کنار مدل جهان

فرض کنید World Model یا شبیه‌ساز، وضعیت زیر را تولید کرده است:

{
  "goal": "انتقال بسته به ایستگاه دوم",
  "current_state": {
    "robot_position": "A3",
    "package_position": "B2",
    "target_position": "D5"
  },
  "available_actions": [
    "move_left",
    "move_right",
    "move_forward",
    "pick_package",
    "place_package"
  ],
  "predicted_paths": [
    {
      "path_id": "p1",
      "steps": 9,
      "result": "goal_reached"
    },
    {
      "path_id": "p2",
      "steps": 7,
      "result": "blocked_at_D3"
    }
  ]
}

یک مدل زبانی می‌تواند این خروجی را به گزارش فارسی یا برنامه سطح بالا تبدیل کند. اما نباید جای World Model، شبیه‌ساز یا کنترل‌کننده را بگیرد.

نمونه اتصال با Python:

import json
import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

model_id = os.environ["DARVAREH_MODEL"]

world_state = {
    "goal": "انتقال بسته به ایستگاه دوم",
    "current_state": {
        "robot_position": "A3",
        "package_position": "B2",
        "target_position": "D5"
    },
    "predicted_paths": [
        {
            "path_id": "p1",
            "steps": 9,
            "result": "goal_reached"
        },
        {
            "path_id": "p2",
            "steps": 7,
            "result": "blocked_at_D3"
        }
    ]
}

response = client.chat.completions.create(
    model=model_id,
    messages=[
        {
            "role": "system",
            "content": """
شما دستیار توضیح نتایج شبیه‌سازی هستید.
فقط براساس داده ورودی پاسخ بده.
نتیجه جدیدی شبیه‌سازی نکن.
مسیر قابل‌اجرا را معرفی کن و دلیل رد مسیر دیگر را کوتاه بنویس.
"""
        },
        {
            "role": "user",
            "content": json.dumps(
                world_state,
                ensure_ascii=False
            )
        }
    ],
    temperature=0.1
)

print(response.choices[0].message.content)

در این معماری:

  • World Model مسیرها را پیش‌بینی می‌کند.
  • شبیه‌ساز نتیجه را بررسی می‌کند.
  • Backend قواعد را اعمال می‌کند.
  • مدل متصل به API درواره نتیجه را توضیح می‌دهد.
  • کنترل‌کننده اقدام تأییدشده را اجرا می‌کند.

کاربردهای API درواره کنار World Model

تبدیل هدف زبان طبیعی به سناریوی ساختاریافته

کاربر می‌نویسد:

ربات باید بسته را بدون ورود به مسیر مسدود به ایستگاه دوم برساند.

مدل زبانی می‌تواند این هدف را به JSON شامل هدف، محدودیت و معیار پایان تبدیل کند.

تولید سناریوی شبیه‌سازی

مدل می‌تواند سناریوهای متنی متنوعی برای آموزش یا ارزیابی پیشنهاد دهد. اجرای سناریو باید توسط شبیه‌ساز انجام شود.

توضیح نتیجه

خروجی عددی یا ساختاریافته شبیه‌ساز می‌تواند به گزارش فارسی قابل‌فهم تبدیل شود.

ساخت Planner سطح بالا

مدل استدلالی می‌تواند هدف را به چند زیرهدف تبدیل کند. World Model سپس درباره اقدام‌های محیطی پیش‌بینی انجام می‌دهد.

تحلیل تصویر یا ویدئو

اگر مدل چندوجهی انتخاب‌شده از ورودی موردنظر پشتیبانی کند، می‌توان از آن برای استخراج توضیح صحنه یا ساخت Context استفاده کرد.

تولید داده مصنوعی

مدل‌های زبانی و مولد می‌توانند در ساخت توضیحات، سناریوها، برچسب‌ها و نمونه‌های آموزشی کنار World Model قرار گیرند.

آیا می‌توان امروز World Model ساخت؟

ساخت یک World Foundation Model عمومی به داده و زیرساخت محاسباتی گسترده نیاز دارد و برای بیشتر تیم‌ها پروژه واقع‌بینانه‌ای نیست.

اما می‌توان یک مدل جهان محدود و تخصصی ساخت.

مسیر عملی‌تر:

  1. محیط محدود را تعریف کنید.
  2. وضعیت‌ها و Actionهای مجاز را مشخص کنید.
  3. داده مشاهده، اقدام و نتیجه جمع‌آوری کنید.
  4. یک شبیه‌ساز پایه بسازید.
  5. مدل پیش‌بینی وضعیت بعدی را آموزش دهید.
  6. Planner را روی مدل آزمایش کنید.
  7. خروجی را در محیط واقعی یا مرجع مقایسه کنید.
  8. مدل زبانی را فقط برای فهم هدف و توضیح نتیجه اضافه کنید.

برای نمونه اولیه حتی می‌توان World Model یادگرفته‌شده را با یک Transition Model قاعده‌محور جایگزین کرد و معماری محصول را پیش از آموزش مدل پیچیده آزمایش کرد.

پرسش‌های متداول

مدل جهان به زبان ساده چیست؟

مدل جهان سیستمی است که نمایش داخلی از یک محیط می‌سازد و پیش‌بینی می‌کند محیط در طول زمان یا بر اثر اقدام عامل چگونه تغییر خواهد کرد.

World Model چه تفاوتی با LLM دارد؟

LLM بیشتر ساختار زبان و متن را یاد می‌گیرد. World Model روی فضا، زمان، وضعیت محیط، حرکت و پیامد اقدام تمرکز دارد.

آیا مدل تولید ویدئو همان مدل جهان است؟

خیر. مدل تولید ویدئو برای ساخت کلیپ طراحی می‌شود. World Model باید وضعیت محیط را حفظ کند و تغییر آن را براساس Action پیش‌بینی کند.

آیا هر مدل چندوجهی یک World Model است؟

خیر. مدل چندوجهی می‌تواند متن، تصویر یا ویدئو را پردازش کند، اما World Model باید پویایی محیط و پیامد اقدام را نیز مدل‌سازی کند.

مدل جهان چه کاربردی دارد؟

رباتیک، شبیه‌سازی، آموزش Agent، بازی، طراحی سه‌بعدی، لجستیک، رانندگی و محیط‌های تعاملی از کاربردهای مهم آن هستند.

JEPA چیست؟

JEPA معماری پیش‌بینی در فضای نمایش انتزاعی است. مدل به‌جای بازسازی تمام پیکسل‌ها، نمایش بخش‌های مهم یا پنهان داده را پیش‌بینی می‌کند.

آیا World Model برای کاربران ایرانی در دسترس است؟

وضعیت هر مدل متفاوت است. برخی پروژه‌ها مانند V-JEPA 2 منابع متن‌باز دارند و برخی سرویس‌ها دارای محدودیت حساب، کشور یا پرداخت هستند. شرایط جاری هر پروژه باید مستقیماً بررسی شود.

آیا درواره World Model ارائه می‌کند؟

مدل‌های چندوجهی یا تولید ویدئو الزاماً World Model نیستند. برای اطمینان باید قابلیت‌ها و مدل‌های فعال کاتالوگ درواره بررسی شوند. درواره می‌تواند لایه مدل زبانی، استدلالی یا چندوجهی معماری شما را فراهم کند.

آیا برای ساخت World Model به LLM نیاز داریم؟

خیر، اما LLM می‌تواند برای فهم هدف کاربر، تولید سناریو، برنامه‌ریزی سطح بالا و توضیح نتایج در کنار World Model استفاده شود.

جمع‌بندی

مدل جهان یکی از مسیرهای مهم تکامل هوش مصنوعی از «کار با کلمات و تصاویر» به سمت «درک محیط و پیش‌بینی پیامد اقدام» است.

World Model تلاش می‌کند:

  • وضعیت محیط را درک کند.
  • تغییرات بعدی را پیش‌بینی کند.
  • پیامد Action را تخمین بزند.
  • اطلاعات لازم برای برنامه‌ریزی را فراهم کند.
  • محیط‌های قابل‌استفاده برای آموزش Agent ایجاد کند.

این مدل با LLM، مدل چندوجهی، تولیدکننده ویدئو، موتور بازی و Digital Twin یکسان نیست؛ هرچند می‌تواند با همه آن‌ها ترکیب شود.

در معماری عملی، مدل زبانی هدف را می‌فهمد، World Model پیامدها را پیش‌بینی می‌کند، شبیه‌ساز قواعد قطعی را اجرا می‌کند و Backend فرایند را مدیریت می‌کند.

برای افزودن لایه زبانی، استدلالی یا چندوجهی به چنین محصولی می‌توانید در درواره ثبت‌نام کنید، API Key بگیرید و مدل مناسب را از کاتالوگ جاری با یک API یکپارچه آزمایش کنید.

مقالات مرتبط

منابع

این مقاله صرفاً با هدف آموزش و اطلاع‌رسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویس‌ها و صفحه سلب مسئولیت را مطالعه کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.