هوش مصنوعی فیزیکی چیست؟ راهنمای Physical AI و رباتهای هوشمند
هوش مصنوعی فیزیکی مجموعهای از مدلها و سیستمهاست که به رباتها و ماشینهای خودکار کمک میکند محیط واقعی را درک کنند، تصمیم بگیرند و اقدام انجام دهند. در این راهنما معماری، کاربردها و تفاوت Physical AI با مدلهای زبانی را بررسی میکنیم.
بخش بزرگی از پیشرفت هوش مصنوعی در سالهای اخیر داخل محیطهای دیجیتال اتفاق افتاده است. مدلهای زبانی متن تولید میکنند، مدلهای تصویری عکس میسازند و مدلهای چندوجهی میتوانند متن، صدا، تصویر و ویدئو را تحلیل کنند.
اما اگر یک سیستم هوش مصنوعی بخواهد جعبهای را از روی زمین بردارد، در انبار حرکت کند، قطعهای را روی خط تولید جابهجا کند یا براساس یک فرمان گفتاری با اشیای واقعی تعامل داشته باشد، تولید متن بهتنهایی کافی نیست.
سیستم باید بتواند:
- محیط اطراف را ببیند و اندازهگیری کند.
- موقعیت و وضعیت اشیا را تشخیص دهد.
- رابطۀ فضایی میان اجسام را بفهمد.
- نتیجۀ احتمالی یک حرکت را پیشبینی کند.
- مجموعهای از اقدامات را برنامهریزی کند.
- فرمان مناسب را به کنترلکننده ماشین یا ربات تحویل دهد.
- پس از هر اقدام، تغییر محیط را دوباره بررسی کند.
حوزهای که این قابلیتها را در ماشینهای فعال در دنیای واقعی ترکیب میکند، هوش مصنوعی فیزیکی یا Physical AI نام دارد.
پاسخ کوتاه: هوش مصنوعی فیزیکی چیست؟
هوش مصنوعی فیزیکی به سیستمهایی گفته میشود که میتوانند محیط واقعی را از طریق دوربین، حسگر و سایر ورودیها درک کنند، درباره وضعیت محیط تصمیم بگیرند و از طریق یک ماشین خودکار یا ربات اقدام انجام دهند.
براساس تعریف رسمی NVIDIA از Physical AI، این فناوری به ماشینهای خودکار اجازه میدهد دنیای فیزیکی را ادراک و درک کنند، درباره آن استدلال کنند و اقدامات پیچیده انجام دهند.
نمونههای هوش مصنوعی فیزیکی عبارتاند از:
- بازوی رباتیکی که اشیای متفاوت را تشخیص میدهد و جابهجا میکند.
- ربات متحرکی که در یک انبار مسیر خود را پیدا میکند.
- ماشین خودرانی که محیط را پیوسته تحلیل میکند.
- ربات انساننمایی که دستورهای زبان طبیعی را به حرکت تبدیل میکند.
- ماشین صنعتی که رفتار خود را با تغییر شرایط خط تولید تطبیق میدهد.
- سامانه کشاورزی که محصول را شناسایی و عملیات مشخصی انجام میدهد.
چرا Physical AI به یکی از موضوعات مهم هوش مصنوعی تبدیل شده است؟
رباتهای صنعتی سنتی معمولاً برای محیطی ثابت و وظیفهای مشخص برنامهریزی میشوند. برای مثال، یک بازوی صنعتی ممکن است هزاران بار یک قطعه را از نقطه مشخصی بردارد و در محل ازپیشتعیینشدهای قرار دهد.
اگر موقعیت قطعه، نوع بستهبندی یا ترتیب کار تغییر کند، سیستم سنتی ممکن است به برنامهریزی مجدد نیاز داشته باشد.
هوش مصنوعی فیزیکی تلاش میکند ماشین را از اجرای صرف یک دستور ثابت به سمت رفتار انعطافپذیرتر ببرد. چنین سیستمی میتواند وضعیت جدید را مشاهده کند، آن را با هدف تعیینشده تطبیق دهد و اقدام بعدی را انتخاب کند.
پیشرفت همزمان چند فناوری این مسیر را سرعت داده است:
- مدلهای چندوجهی
- بینایی ماشین
- مدلهای جهان
- مدلهای Vision-Language-Action
- یادگیری تقویتی
- شبیهسازی فیزیکی
- داده مصنوعی
- پردازندههای مناسب اجرای مدل روی ربات
- مدلهای زبانی و استدلالی
در نتیجه، هوش مصنوعی از تولید اطلاعات در یک صفحه نمایش به سمت تعامل با محیط واقعی حرکت کرده است.
تفاوت هوش مصنوعی فیزیکی با هوش مصنوعی مولد
هوش مصنوعی مولد برای ایجاد محتوای جدید مانند متن، تصویر، صوت، کد یا ویدئو طراحی شده است. خروجی اصلی آن معمولاً یک محتوای دیجیتال است.
هوش مصنوعی فیزیکی باید خروجی خود را به تصمیم یا عملی تبدیل کند که در محیط واقعی اجرا میشود.
| معیار | هوش مصنوعی مولد | هوش مصنوعی فیزیکی |
|---|---|---|
| محیط اصلی | فضای دیجیتال | دنیای واقعی یا شبیهسازی فیزیکی |
| ورودی | متن، تصویر، صوت، ویدئو | داده حسگر، تصویر، ویدئو، فرمان و وضعیت ماشین |
| خروجی | متن، تصویر، صوت، کد یا ویدئو | برنامه اقدام یا فرمان قابلاجرا |
| نیاز به بازخورد محیط | همیشه لازم نیست | بخش اصلی عملکرد سیستم است |
| نمونه | تولید مقاله یا تصویر | هدایت ربات برای انجام یک وظیفه |
| محدودیت اصلی | کیفیت و صحت محتوا | ادراک، زمانبندی، برنامهریزی و اجرای فیزیکی |
این دو حوزه کاملاً جدا نیستند. مدلهای مولد میتوانند برای تولید سناریوهای آموزشی، ساخت داده مصنوعی، تفسیر فرمان انسان و برنامهریزی سطح بالا در یک سیستم فیزیکی استفاده شوند.
تفاوت هوش مصنوعی فیزیکی با رباتیک چیست؟
رباتیک حوزه گستردهای است که طراحی مکانیکی، الکترونیک، کنترل، حسگرها، محرکها و نرمافزار ربات را در بر میگیرد.
هوش مصنوعی فیزیکی یکی از لایههای هوشمند این مجموعه است.
یک ربات میتواند بدون استفاده از مدلهای پیشرفته هوش مصنوعی کار کند. برای مثال، دستگاهی که طبق مسیر و زمانبندی ثابت حرکت میکند همچنان یک سیستم رباتیک است.
از طرف دیگر، مدل هوش مصنوعی فیزیکی برای اثرگذاری در دنیای واقعی به یک بدن یا ماشین نیاز دارد؛ مانند:
- بازوی مکانیکی
- ربات چرخدار
- پهپاد
- خودروی خودران
- ربات انساننما
- ماشین صنعتی
- سامانه دارای دوربین و محرک
بنابراین ربات، بدن و اجزای اجرایی را فراهم میکند و هوش مصنوعی فیزیکی بخشی از توان ادراک، تصمیمگیری و تطبیق را به آن اضافه میکند.
هوش مصنوعی تجسمیافته یا Embodied AI چیست؟
Embodied AI به هوش مصنوعیای اشاره دارد که از طریق یک بدن فیزیکی یا مجازی با محیط تعامل میکند. این بدن میتواند یک ربات واقعی یا یک عامل موجود در شبیهساز سهبعدی باشد.
Physical AI و Embodied AI در بسیاری از متون نزدیک به یکدیگر استفاده میشوند، اما میتوان میان آنها تمایز ظریفی در نظر گرفت:
- Embodied AI بیشتر بر یادگیری و هوشمندی از طریق تعامل یک عامل با محیط تمرکز دارد.
- Physical AI بیشتر بر ساخت سیستمهای خودکاری تمرکز میکند که در جهان فیزیکی ادراک، تصمیمگیری و اقدام میکنند.
در عمل، بسیاری از پروژههای رباتیک پیشرفته در هر دو دسته قرار میگیرند.
هوش مصنوعی فیزیکی چگونه کار میکند؟
یک سیستم Physical AI معمولاً از چند لایه تشکیل میشود. همۀ این لایهها الزاماً توسط یک مدل واحد اجرا نمیشوند.
۱. دریافت اطلاعات از محیط
ربات ابتدا باید وضعیت محیط را دریافت کند. این اطلاعات ممکن است از منابع زیر به دست آیند:
- دوربین معمولی
- دوربین عمقسنج
- حسگر فاصله
- لیدار
- میکروفون
- حسگر فشار
- حسگر نیرو
- حسگر موقعیت مفصلها
- شتابسنج
- دادههای داخلی ماشین
برای نمونه، یک بازوی رباتیکی باید بتواند موقعیت جسم، زاویه قرارگیری، فاصلۀ آن تا بازو و وضعیت گیره را تشخیص دهد.
۲. ادراک محیط
داده خام حسگر باید به اطلاعات قابلاستفاده تبدیل شود.
در این مرحله، مدلهای بینایی ماشین و چندوجهی ممکن است موارد زیر را تشخیص دهند:
- چه اشیایی در صحنه وجود دارند؟
- هر شیء در چه موقعیتی قرار دارد؟
- کدام بخش از جسم برای گرفتن مناسب است؟
- چه موانعی در مسیر وجود دارند؟
- وضعیت فعلی وظیفه چیست؟
- آیا اقدام قبلی با موفقیت انجام شده است؟
این لایه فقط «دیدن» نیست؛ سیستم باید معنای آنچه دیده میشود را نیز در ارتباط با هدف فعلی درک کند.
۳. ساخت نمایش داخلی از وضعیت
سیستم به یک نمایش قابلاستفاده از محیط نیاز دارد. این نمایش میتواند شامل فهرست اشیا، موقعیتها، روابط فضایی و وضعیت فعلی ربات باشد.
مدل جهان یا World Model میتواند به سیستم کمک کند پیشبینی کند اگر اقدامی انجام شود، وضعیت محیط چگونه تغییر خواهد کرد.
برای مثال:
- اگر گیره از این زاویه نزدیک شود، آیا به جسم میرسد؟
- اگر جعبه جابهجا شود، آیا مسیر باز میشود؟
- اگر ربات به سمت راست حرکت کند، موقعیت آن نسبت به هدف چه تغییری میکند؟
مدل جهان یکی از اجزای احتمالی Physical AI است، نه معادل کامل آن. برای آشنایی دقیقتر، مقاله مدل جهان چیست؟ را بخوانید.
۴. استدلال و برنامهریزی
پس از درک وضعیت، سیستم باید راه رسیدن به هدف را مشخص کند.
اگر فرمان کاربر این باشد:
«بطری آبی را از روی میز بردار و داخل جعبه سمت چپ بگذار.»
برنامه سطح بالا ممکن است شامل این مراحل باشد:
- بطری آبی را پیدا کن.
- موقعیت جعبه سمت چپ را تعیین کن.
- مسیر مناسب بازو تا بطری را انتخاب کن.
- گیره را در موقعیت صحیح قرار بده.
- بطری را بردار.
- آن را به سمت جعبه منتقل کن.
- بطری را داخل جعبه رها کن.
- نتیجه را دوباره مشاهده کن.
مدلهای زبانی و استدلالی میتوانند در تبدیل هدف طبیعی انسان به چنین برنامهای نقش داشته باشند، اما جزئیات حرکت معمولاً به کنترلکنندههای تخصصی سپرده میشود.
۵. تولید و اجرای اقدام
برنامه سطح بالا باید به فرمانهایی تبدیل شود که بدن ربات قادر به اجرای آنها باشد.
این فرمانها میتوانند شامل موارد زیر باشند:
- حرکت به یک موقعیت
- چرخاندن مفصل
- باز یا بستهکردن گیره
- تنظیم سرعت
- دنبالکردن مسیر
- توقف در یک نقطه
- فعالکردن ابزار مشخص
یک مدل زبانی عمومی معمولاً نباید مستقیماً مقادیر خام موتور را تولید کند. میان تصمیم سطح بالا و محرکهای فیزیکی، کنترلکنندهها و نرمافزارهای رباتیک تخصصی قرار میگیرند.
۶. دریافت بازخورد و اصلاح برنامه
دنیای واقعی کاملاً ثابت نیست. ممکن است جسم جابهجا شود، گرفتن آن در بار اول موفق نباشد یا مسیر تغییر کند.
بنابراین سیستم پس از اقدام باید محیط را دوباره مشاهده کند:
مشاهده محیط
↓
درک وضعیت
↓
انتخاب اقدام
↓
اجرای اقدام
↓
مشاهده نتیجه
↓
اصلاح اقدام بعدی
این حلقه ادراک و اقدام یکی از تفاوتهای اصلی Physical AI با یک مدل تولید متن معمولی است.
مدل Vision-Language-Action یا VLA چیست؟
مدل Vision-Language-Action که بهاختصار VLA نامیده میشود، مدلی است که سه نوع اطلاعات را به یکدیگر متصل میکند:
- Vision: آنچه ربات میبیند.
- Language: فرمان یا هدفی که با زبان طبیعی بیان شده است.
- Action: عملی که ربات باید انجام دهد.
یک مدل VLA میتواند تصویر محیط و دستور متنی را دریافت و آنها را به اقدام رباتیک تبدیل کند.
Google DeepMind در معرفی RT-2 توضیح داده است که این مدل از دادههای وب و رباتیک یاد میگیرد و دانش بصری و زبانی را به دستورهای قابلاستفاده برای کنترل ربات تبدیل میکند.
نسلهای جدیدتر این رویکرد دامنه وسیعتری از ادراک، استدلال فضایی و برنامهریزی را پوشش میدهند. برای مثال، Gemini Robotics 2 بهعنوان مدل VLA برای تبدیل ورودیهای بینایی و زبان به کنترل حرکتی معرفی شده است.
مدل VLA را میتوان پلی میان «مدلی که محیط و دستور را میفهمد» و «ماشینی که باید اقدام کند» در نظر گرفت.
تفاوت VLM، VLA و LLM
| نوع مدل | ورودی اصلی | خروجی اصلی | کاربرد |
|---|---|---|---|
| LLM | متن | متن یا داده ساختاریافته | گفتگو، تحلیل، برنامهریزی و تولید محتوا |
| VLM | متن و تصویر یا ویدئو | متن یا نمایش معنایی | درک صحنه و پاسخ درباره محتوای بصری |
| VLA | تصویر، زبان و وضعیت ربات | اقدام یا سیاست حرکتی | تعامل ربات با محیط |
| World Model | وضعیت و اقدام | پیشبینی وضعیت آینده | شبیهسازی پیامد اقدامات |
در یک سیستم پیشرفته ممکن است چند مورد از این مدلها کنار یکدیگر استفاده شوند.
هوش مصنوعی فیزیکی چگونه آموزش داده میشود؟
آموزش ربات در دنیای واقعی زمانبر و پرهزینه است. به همین دلیل، ترکیبی از داده واقعی، شبیهسازی، نمایش انسانی و یادگیری تقویتی استفاده میشود.
دادههای واقعی ربات
ربات بارها یک وظیفه را انجام میدهد و اطلاعاتی مانند تصویر، وضعیت حسگرها و حرکتهای اجراشده ثبت میشوند. این دادهها به مدل کمک میکنند ارتباط میان مشاهده و اقدام را یاد بگیرد.
یادگیری از نمایش انسانی
در این روش، انسان یک وظیفه را انجام میدهد یا حرکت صحیح ربات را هدایت میکند. مدل از این نمونهها میآموزد که در وضعیت مشابه چه اقدامی مناسب است.
آموزش در شبیهساز
محیط، ربات و اشیا در فضای سهبعدی شبیهسازی میشوند. ربات میتواند بدون اشغال تجهیزات واقعی، وظایف را بارها تمرین کند.
طبق راهنمای آموزشی Physical AI انویدیا، شبیهسازی، Digital Twin، آموزش Policy و انتقال از شبیهساز به دنیای واقعی از اجزای مهم این حوزه هستند.
داده مصنوعی
در شبیهساز میتوان تعداد زیادی صحنه با نور، زاویه، مکان اشیا و شرایط متفاوت تولید کرد. داده مصنوعی به افزایش تنوع مجموعه آموزشی کمک میکند.
برای آشنایی با این مفهوم، مقاله داده مصنوعی چیست؟ را ببینید.
یادگیری تقویتی
در یادگیری تقویتی، سیستم با انجام اقدام و دریافت بازخورد یاد میگیرد. انجام موفق وظیفه امتیاز مثبت و نتیجۀ نامطلوب امتیاز پایینتری ایجاد میکند.
ربات با تکرار تعداد زیادی آزمایش میتواند سیاست بهتری برای انجام وظیفه پیدا کند.
Sim-to-Real چیست؟
Sim-to-Real به انتقال مهارتی گفته میشود که مدل در شبیهساز آموخته است و باید آن را روی ربات واقعی اجرا کند.
این انتقال همیشه ساده نیست؛ زیرا شبیهسازی نمیتواند تمام جزئیات جهان واقعی را کاملاً بازسازی کند. تفاوت در اصطکاک، نور، وزن، دوربین، تأخیر تجهیزات و مشخصات موتور میتواند نتیجه را تغییر دهد.
برای کاهش این فاصله، توسعهدهندگان معمولاً:
- شرایط شبیهسازی را متنوع میکنند.
- از داده واقعی برای تنظیم نهایی استفاده میکنند.
- مشخصات فیزیکی تجهیزات را دقیقتر مدل میکنند.
- مدل را در سناریوهای متفاوت آزمایش میکنند.
- بازخورد اجرای واقعی را به فرایند آموزش بازمیگردانند.
مهمترین کاربردهای هوش مصنوعی فیزیکی
تولید و کارخانه
رباتهای هوشمند میتوانند قطعات را تشخیص دهند، وضعیت خط را تحلیل کنند و برای کارهای متنوعتری استفاده شوند.
کاربردهای احتمالی:
- جابهجایی قطعات
- مونتاژ
- بستهبندی
- مرتبسازی
- تشخیص وضعیت محصول
- تأمین قطعه برای ایستگاههای کاری
انبارداری و لجستیک
رباتهای متحرک میتوانند مسیر خود را در انبار پیدا کنند و کالا را میان بخشهای مختلف انتقال دهند.
ترکیب ادراک محیط و برنامهریزی به سیستم کمک میکند مسیر را براساس وضعیت لحظهای انتخاب کند.
کشاورزی
Physical AI میتواند در ماشینهایی برای تشخیص محصول، برداشت، پایش رشد یا انجام عملیات دقیق روی گیاهان استفاده شود.
رباتهای خدماتی
ربات خدماتی باید فرمان انسان را بفهمد، محیط را مشاهده کند و وظیفه را به مجموعهای از اقدامات تبدیل کند.
خودرو و ماشینهای خودکار
خودروهای خودران و ماشینهای صنعتی متحرک به ادراک لحظهای، پیشبینی رفتار محیط و برنامهریزی حرکت نیاز دارند.
رباتهای انساننما
هدف بسیاری از پروژههای ربات انساننما ساخت ماشینی است که بتواند ابزارها و محیطهای طراحیشده برای انسان را بهکار بگیرد.
مدلهای چندوجهی، استدلال فضایی و VLA میتوانند به این رباتها در فهم دستور و انجام وظایف متنوع کمک کنند.
آیا یک مدل زبانی میتواند ربات را کنترل کند؟
مدل زبانی میتواند یکی از اجزای سیستم باشد، اما بهتنهایی یک سیستم کنترل ربات کامل نیست.
مدل زبانی در این بخشها کاربرد دارد:
- درک فرمان کاربر
- تبدیل هدف به مراحل اجرایی
- انتخاب ابزار یا مهارت مناسب
- پاسخگویی درباره وضعیت کار
- توضیح نتیجه
- برنامهریزی سطح بالا
- تولید داده ساختاریافته برای نرمافزار هماهنگکننده
اما اجرای فیزیکی به اجزای دیگری نیاز دارد:
- مدل ادراک بصری
- وضعیت حسگرها
- نرمافزار رباتیک
- برنامهریز حرکت
- کنترلکننده
- مدل VLA یا Policy
- رابط سختافزار
در معماری درست، خروجی مدل زبانی قبل از اجرا به یک برنامۀ ساختاریافته تبدیل و توسط لایههای تخصصی پردازش میشود.
نقش API هوش مصنوعی در Physical AI چیست؟
API مدلهای هوش مصنوعی میتواند لایه زبان، تحلیل و برنامهریزی یک سیستم رباتیک را تأمین کند.
برای مثال، نرمافزار میتواند خلاصهای از وضعیت محیط را به مدل بفرستد:
{
"goal": "جعبه آبی را به ایستگاه شماره ۲ منتقل کن",
"robot_state": "idle",
"objects": [
{
"id": "box_17",
"type": "box",
"color": "blue",
"location": "shelf_a"
}
],
"available_skills": [
"move_to",
"pick",
"place"
]
}
مدل میتواند یک برنامه سطح بالا تولید کند:
{
"steps": [
{
"skill": "move_to",
"target": "shelf_a"
},
{
"skill": "pick",
"target": "box_17"
},
{
"skill": "move_to",
"target": "station_2"
},
{
"skill": "place",
"target": "station_2"
}
]
}
این خروجی هنوز فرمان مستقیم موتور نیست. نرمافزار ربات باید هر مرحله را اعتبارسنجی و از طریق کنترلکننده مناسب اجرا کند.
نمونه اتصال لایه برنامهریزی به API درواره
درواره یک API یکپارچه و سازگار با OpenAI برای دسترسی به مدلهای مختلف هوش مصنوعی ارائه میدهد. در یک پروژه آزمایشی Physical AI میتوان از مدلهای متنی، استدلالی یا چندوجهی موجود در کاتالوگ برای لایههای سطح بالاتر استفاده کرد.
نمونه درخواست با پایتون:
import os
import json
import requests
scene = {
"goal": "جعبه آبی را به ایستگاه شماره ۲ منتقل کن",
"robot_state": "idle",
"objects": [
{
"id": "box_17",
"type": "box",
"color": "blue",
"location": "shelf_a"
}
],
"available_skills": ["move_to", "pick", "place"]
}
response = requests.post(
"https://api.darvareh.ir/v1/chat/completions",
headers={
"Authorization": f"Bearer {os.environ['DARVAREH_API_KEY']}",
"Content-Type": "application/json"
},
json={
"model": "MODEL_ID_FROM_DARVAREH_CATALOG",
"messages": [
{
"role": "system",
"content": (
"شما برنامهریز سطح بالای یک ربات هستید. "
"فقط از مهارتهای اعلامشده استفاده کنید و "
"خروجی را بهصورت JSON شامل آرایه steps ارائه دهید."
)
},
{
"role": "user",
"content": json.dumps(scene, ensure_ascii=False)
}
],
"temperature": 0.1
},
timeout=60
)
response.raise_for_status()
plan = response.json()["choices"][0]["message"]["content"]
print(plan)
در پیادهسازی واقعی باید خروجی مدل پیش از ارسال به نرمافزار ربات بررسی شود. همچنین پشتیبانی از تصویر، خروجی ساختاریافته یا قابلیتهای دیگر به مدل و Endpoint انتخابشده بستگی دارد.
درواره خودِ شبیهساز، کنترلکننده حرکت یا مدل اختصاصی ربات نیست. نقش آن در چنین معماریای فراهمکردن دسترسی API به مدلهای موجود برای لایههایی مانند درک زبان، تحلیل ورودی، برنامهریزی و توضیح نتیجه است.
معماری پیشنهادی برای یک نمونه اولیه
برای ساخت نمونه اولیه، میتوان سیستم را به پنج بخش تقسیم کرد:
- لایه دریافت داده از دوربین و حسگر
- لایه تشخیص اشیا و خلاصهسازی وضعیت
- لایه برنامهریزی سطح بالا با مدل هوش مصنوعی
- لایه تبدیل برنامه به مهارتهای ازپیشتعریفشده ربات
- لایه کنترل و دریافت بازخورد اجرا
این جداسازی باعث میشود مدل برنامهریز بدون نیاز به تولید جزئیات خام حرکتی، فقط از مجموعهای محدود از مهارتهای مشخص استفاده کند.
برای مثال:
فرمان کاربر
↓
مدل زبانی یا چندوجهی
↓
برنامه ساختاریافته
↓
انتخاب مهارت ربات
↓
کنترلکننده حرکت
↓
ربات و محیط
در این معماری میتوان مدلهای مختلف را در لایه برنامهریزی آزمایش کرد، بدون آنکه تمام نرمافزار کنترل ربات تغییر کند.
چگونه مدل مناسب را برای لایه هوشمند ربات انتخاب کنیم؟
مدل مناسب فقط مدلی نیست که بالاترین امتیاز عمومی را داشته باشد. انتخاب باید با نیاز سیستم هماهنگ باشد.
معیارهای مهم عبارتاند از:
- توانایی درک دقیق فرمان
- کیفیت استدلال فضایی
- پشتیبانی از تصویر یا ویدئو
- توانایی تولید JSON معتبر
- سرعت پاسخ
- هزینه هر درخواست
- طول Context
- کیفیت زبان فارسی
- توانایی Tool Calling
- ثبات در دنبالکردن محدودیتها
- دسترسی مدل از طریق API
- امکان اجرا روی دستگاه، سرور محلی یا سرویس ابری
بهتر است مجموعهای از سناریوهای واقعی تهیه و چند مدل با ورودیهای یکسان مقایسه شوند.
اشتباهات رایج درباره Physical AI
هوش مصنوعی فیزیکی همان ربات انساننماست
ربات انساننما فقط یکی از کاربردهاست. بازوی صنعتی، ربات انبار، ماشین کشاورزی و خودروی خودران نیز میتوانند از Physical AI استفاده کنند.
اتصال یک LLM به ربات برای ساخت Physical AI کافی است
مدل زبانی میتواند فرمان را بفهمد و برنامه تولید کند، اما ادراک محیط، تخمین وضعیت، برنامهریزی حرکت و کنترل سختافزار به اجزای تخصصی نیاز دارند.
مدل جهان و Physical AI یک مفهوم هستند
مدل جهان پیامد اقدامات را پیشبینی میکند؛ Physical AI زنجیره کامل ادراک، برنامهریزی، اجرا و دریافت بازخورد را پوشش میدهد.
مدل چندوجهی همان مدل VLA است
مدل چندوجهی ممکن است تصویر و متن را دریافت و پاسخ متنی تولید کند. مدل VLA بهطور مشخص برای پیوند ورودی بصری و زبانی با اقدام طراحی شده است.
هر مهارتی که در شبیهساز آموخته شود مستقیماً در واقعیت کار میکند
میان شبیهسازی و جهان واقعی تفاوت وجود دارد. مدل باید در شرایط واقعی نیز آزمایش و متناسب با تجهیزات تنظیم شود.
آینده هوش مصنوعی فیزیکی
مسیر فعلی این حوزه به سمت مدلهایی حرکت میکند که بتوانند:
- وظایف بیشتری را با یک مدل واحد انجام دهند.
- فرمان طبیعی انسان را بهتر درک کنند.
- مهارتهای آموختهشده را میان رباتهای مختلف منتقل کنند.
- از تصویر و ویدئو برای پیگیری پیشرفت کار استفاده کنند.
- وظایف طولانی را به مراحل کوچکتر تقسیم کنند.
- با داده و نمایش انسانی کمتری مهارت جدید بیاموزند.
- میان برنامهریزی سطح بالا و کنترل حرکت ارتباط مؤثرتری ایجاد کنند.
در ژوئیه ۲۰۲۶، Google DeepMind مدلهای Gemini Robotics 2 را با تمرکز بر برنامهریزی چندمرحلهای، کنترل رباتهای مختلف و استدلال تجسمیافته معرفی کرد. این روند نشان میدهد مرز میان مدلهای چندوجهی، Agentها و رباتیک در حال نزدیکترشدن است.
بااینحال، محصول نهایی همچنان به ترکیب مدل، داده، شبیهسازی، نرمافزار رباتیک، کنترلکننده و سختافزار مناسب وابسته است.
پرسشهای متداول
Physical AI چیست؟
Physical AI یا هوش مصنوعی فیزیکی به سیستمهایی گفته میشود که میتوانند محیط واقعی را ادراک کنند، درباره آن تصمیم بگیرند و از طریق ربات یا ماشین خودکار اقدام انجام دهند.
تفاوت Physical AI و Generative AI چیست؟
هوش مصنوعی مولد معمولاً محتوای دیجیتال تولید میکند؛ اما هوش مصنوعی فیزیکی باید اطلاعات محیط را به تصمیم و اقدام قابلاجرا در جهان واقعی تبدیل کند.
مدل VLA چیست؟
مدل Vision-Language-Action ورودی بصری و فرمان زبانی را دریافت و آنها را به اقدام یا سیاست قابلاستفاده برای ربات تبدیل میکند.
آیا ChatGPT یا یک LLM میتواند مستقیماً ربات را کنترل کند؟
مدل زبانی میتواند برای درک فرمان و برنامهریزی سطح بالا استفاده شود، اما کنترل ربات به مدلهای ادراک، برنامهریز حرکت، کنترلکننده و رابط سختافزار نیاز دارد.
مدل جهان چه نقشی در هوش مصنوعی فیزیکی دارد؟
مدل جهان میتواند وضعیت محیط و پیامد احتمالی اقدامات را پیشبینی کند. این قابلیت به برنامهریزی بهتر کمک میکند، اما فقط یکی از اجزای سیستم Physical AI است.
آیا هوش مصنوعی فیزیکی فقط برای رباتهای انساننماست؟
خیر. بازوهای صنعتی، رباتهای متحرک، ماشینهای کشاورزی، خودروهای خودران و تجهیزات انبار نیز میتوانند از آن استفاده کنند.
آیا میتوان در یک پروژه رباتیک از API درواره استفاده کرد؟
بله، اگر مدل مناسب در کاتالوگ درواره موجود باشد، میتوان از API برای لایههایی مانند درک زبان، تحلیل تصویر، برنامهریزی سطح بالا یا تولید خروجی ساختاریافته استفاده کرد. کنترل مستقیم سختافزار باید در لایه تخصصی ربات انجام شود.
جمعبندی
هوش مصنوعی فیزیکی مرحلهای از توسعۀ هوش مصنوعی است که مدلها را از محیط صرفاً دیجیتال وارد چرخه ادراک و اقدام در جهان واقعی میکند.
یک سیستم Physical AI باید بتواند محیط را مشاهده کند، وضعیت را بفهمد، هدف را به برنامه تبدیل کند، اقدام مناسب را از طریق ماشین اجرا کند و براساس نتیجۀ اجرا تصمیم بعدی را تغییر دهد.
مدلهای چندوجهی، مدلهای جهان، VLA، داده مصنوعی، شبیهسازی و یادگیری تقویتی هرکدام بخشی از این زنجیره را تشکیل میدهند.
برای تیمهایی که قصد ساخت یک نمونه اولیه دارند، استفاده از API مدلهای هوش مصنوعی در لایه زبان، تحلیل و برنامهریزی میتواند شروع مناسبی باشد. با API درواره میتوانید مدلهای موجود را از طریق یک رابط یکپارچه آزمایش و براساس کیفیت فارسی، سرعت، هزینه و قابلیتهای موردنیاز مقایسه کنید.
مقالات مرتبط
- مدل جهان چیست؟ تفاوت World Model با LLM
- داده مصنوعی چیست؟
- هوش مصنوعی چندوجهی چیست؟
- مدل استدلالی چیست؟
- مدلهای هوش مصنوعی؛ راهنمای انتخاب مدل
منابع
- What Is Physical AI? — NVIDIA
- Physical AI Learning — NVIDIA Documentation
- RT-2: Vision-Language-Action Model — Google DeepMind
- Gemini Robotics 2 — Google DeepMind
- Gemini Robotics 2؛ معرفی رسمی ژوئیه ۲۰۲۶
این مقاله صرفاً با هدف آموزش و اطلاعرسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویسها و صفحه سلب مسئولیت را مطالعه کنید.