ورزشی

نمایش تغییر شکل‌های عجیب بدن در ویدیوهای ژیمناستیک و افشای خطاهای هوش مصنوعی

۰۶ دی ۱۴۰۳ - ۱۳:۵۱ arstechnica منبع 399 بازدید
نمایش تغییر شکل‌های عجیب بدن در ویدیوهای ژیمناستیک و افشای خطاهای هوش مصنوعی

سورا (Sora) شرکت OpenAI ویدیویی گیج‌کننده از ژیمناستیک تولید کرد: ماجرا از چه قرار است؟» روز چهارشنبه، ویدیویی که توسط مدل جدید تولید ویدیو OpenAI یعنی Sora ساخته شده، در شبکه‌های اجتماعی به شدت پربازدید شد. این ویدیو ژیمناستی را نشان می‌دهد که در حین اجرای حرکات روی زمین (که شبیه به مسابقات المپیک است)، ناگهان دست‌ها و پاهای اضافی به بدنش اضافه می‌شود و حتی برای لحظاتی سرش از روی بدن ناپدید می‌گردد. این اشتباهات عجیب در ویدیو که از آن‌ها با اصطلاح “jabberwockies” (اشیاء یا موجودات خیالی و بی‌منطق) یاد می‌شود، دیدگاه جالبی درباره نحوه کارکرد مولدهای ویدیو با هوش مصنوعی و چگونگی بهبود آن‌ها در آینده به ما می‌دهد.

در این ویدیو، ژیمناست در حال اجرای حرکات چرخشی و پشتک زدن است، اما همزمان با چرخش‌ها، اندام‌های جدیدی به‌سرعت ظاهر شده و شکل خود را تغییر می‌دهند. در ثانیه نهم ویدیو، سرِ ژیمناست ناپدید شده و سپس دوباره روی بدن او ظاهر می‌شود. «دی‌دی داس» (Deedy Das)، سرمایه‌گذار خطرپذیر که این ویدیو را در شبکه X به اشتراک گذاشت، گفت: «هرچقدر هم که Sora جدید باحال باشد، ورزش ژیمناستیک همچنان یک آزمون دشوار برای ویدیوهای ساخته شده با هوش مصنوعی است.» این ویدیو واکنش‌های طنزآمیز زیادی را به دنبال داشت؛ از جمله یکی از کاربران در Bluesky نوشت: «سلام، من اینجا یک متخصص ژیمناستیک هستم! این اصلاً خنده‌دار نیست؛ ژیمناست‌ها فقط وقتی در دردسر بسیار جدی هستند که چنین حرکاتی انجام می‌دهند!»

ما با «داس» تماس گرفتیم و او تأیید کرد که این ویدیو را با استفاده از Sora ساخته است. او همچنین اشاره کرد که پرامپت (Prompt) او بسیار طولانی و در چهار بخش تقسیم شده بود و شامل دستورالعمل‌های بسیار دقیق بود؛ مانند: «ژیمناست از گوشه سمت راست عقب شروع می‌کند، در حالی که پای راست او به سمت عقب و در وضعیت B-plus قرار دارد.» داس خاطرنشان کرد: «در شش ماه گذشته دیده‌ام که مدل‌های تبدیل متن به ویدیو (Text-to-Video) با حرکات پیچیده مثل ژیمناستیک دست‌وپنجه نرم می‌کنند.» او قصد داشت Sora را امتحان کند چون فکر می‌کرد در زمینه «ثبات کاراکتر» (Character Consistency) پیشرفت کرده است. او اشاره کرد که اگرچه این مدل نسبت به نسخه‌های قبلی (که در آن‌ها ژیمناست‌ها ناگهان تله‌پورت می‌شدند یا وسط پشتک زدن لباسشان عوض می‌شد) بهتر شده، اما هنوز هم بسیار عجیب به نظر می‌رسد. او گفت: «امیدوار بودیم ویدیوهای هوش مصنوعی به‌طور خودکار قوانین فیزیک را یاد بگیرند، اما هنوز این اتفاق نیفتاده است!»

اما مشکل از کجا ناشی می‌شود؟

برای درک علت شکست این ویدیو، باید به نحوه تولید حرکات توسط Sora نگاه کنیم. در مرحله آموزش (Training)، شرکت OpenAI ویدیوهای نمونه از حرکات ژیمناستیک را در کنار انواع دیگر ویدیوها به مدل داده است. این کار به هوش مصنوعی کمک می‌کند تا تصاویر را با توضیحات متنی مرتبط کند. این آموزش تنها یک بار پیش از عرضه مدل انجام می‌شود. وقتی شما بعداً یک پرامپت متنی به Sora می‌دهید، این مدل از ارتباطات آماری بین کلمات و تصاویر برای ساخت ویدیو استفاده می‌کند؛ در واقع Sora بر اساس آخرین فریم، پیش‌بینی می‌کند که فریم بعدی چه باید باشد.

با این حال، Sora روشی برای حفظ ثبات در طول زمان دارد. طبق اسناد فنی سیستم Sora، آن‌ها با دادن «پیش‌بینیِ چندین فریم آینده» (Foresight) به مدل، سعی کردند اطمینان حاصل کنند که سوژه حتی اگر برای لحظه‌ای از کادر خارج شد، همان شخصیت باقی بماند. اما به نظر می‌رسد این مشکل هنوز کاملاً حل نشده است. حرکت سریع اندام‌ها در این ویدیو، پیش‌بینی دقیق فریم بعدی را برای Sora دشوار می‌کند. نتیجه، ترکیبی گیج‌کننده از ویدیوهای ژیمناستیک است که در آن یک ژیمناست، پشتک‌ها و چرخش‌های متوالی را انجام می‌دهد، اما Sora نمی‌تواند آن‌ها را با ترتیب درست قرار دهد؛ زیرا مدل بر اساس «میانگین حرکات» موجود در داده‌های آموزشی محدود خود عمل می‌کند که احتمالاً فاقد اطلاعات دقیق درباره جزئیات حرکت اندام‌ها بوده است.

دسته‌بندی‌ها: هوش مصنوعی ورزش
تبلیغات
نویسنده

درباره نویسنده: arstechnica

با کلیک روی لینک منبع، می‌توانید مستقیماً به وب‌سایتی که این خبر از آن تهیه شده است مراجعه کنید.

نظرات کاربران (0)

تاکنون دیدگاهی برای این خبر ثبت نشده است.

ارسال دیدگاه