3 دقیقه
شیائومی یک ضربه مهم به رقابت رانندگی خودران وارد کرده است. چارچوب تازه منتشرشده OneVL اکنون متنباز شده و هدف آن جاهطلبانه است: دادن روشی بهتر به سیستمهای خودران برای خواندن جاده، استدلال در شرایط نامطمئن و پیشبینی اتفاقهای بعدی.
این موضوع اهمیت دارد، چون هوش مصنوعی رانندگی خودران سالهاست میان دو مکتب فکری متفاوت تقسیم شده است. یک سو روی مدلهای Vision Language Action یا سامانههای VLA تمرکز دارد که صحنههای ترافیکی را تفسیر میکنند و آن فهم را به تصمیمهای رانندگی تبدیل میکنند. سوی دیگر به مدلهای جهان متکی است که برای شبیهسازی روند احتمالی یک موقعیت در چند ثانیه آینده طراحی شدهاند. شیائومی میگوید OneVL این دو مسیر را از طریق استدلال در فضای نهفته در یک چارچوب واحد کنار هم میآورد؛ روشی که قرار است پیشبینی و تصمیمگیری را سریعتر و کارآمدتر کند.
به زبان ساده، این شرکت تلاش میکند یکی از سختترین مسائل در فناوری خودروهای خودران را حل کند: فقط دیدن جاده نیست، بلکه درک علت و معلول در لحظه است. یک عابر از پیادهرو وارد خیابان میشود. یک اسکوتر از میان خط عبور میکند. خودروی جلویی در تقاطع مردد میماند. اینها تصویرهای ثابت نیستند. اینها معماهای متحرکاند. شیائومی معتقد است OneVL برای مدیریت این پیچیدگی با دقتی بیشتر از رویکردهای سنتی ساخته شده است.
این شرکت میگوید چارچوب جدید توانایی استدلال مدل XLA را گسترش میدهد و هم سرعت استنتاج و هم دقت را افزایش میدهد. همچنین ادعا میکند در بنچمارکهای رایج مرتبط با ادراک، استدلال و برنامهریزی نتایج بسیار خوبی به دست آورده است؛ سه حوزهای که در قلب نرمافزار خودروهای خودران قرار دارند. شیائومی حتی فراتر میرود و میگوید OneVL میتواند از استدلال صریح Chain of Thought از نظر دقت بهتر عمل کند، در حالی که سرعت آن نزدیک به سامانههای استنتاج در فضای نهفته باقی میماند؛ سامانههایی که عمدتاً برای پیشبینی پاسخ نهایی بهینه شدهاند.
نه فقط سریعتر، بلکه قابل اعتمادتر
یکی از بخشهای جالب این رونمایی، تأکید شیائومی بر تفسیرپذیری است. در رانندگی خودران، اعداد عملکرد تنها بخشی از ماجرا هستند. مهندسان، نهادهای نظارتی و در نهایت سرنشینان میخواهند بدانند یک ماشین چرا تصمیمی خاص گرفته است. شیائومی میگوید OneVL میتواند اقدامات خود را هم به زبان طبیعی و هم به شکل بصری توضیح دهد و در عمل به توسعهدهندگان دیدی شفافتر از این بدهد که مدل چگونه به نتیجه رسیده و انتظار دارد در ادامه چه اتفاقی در جاده رخ دهد.
این قابلیت میتواند فراتر از دموهای پژوهشی بسیار کاربردی باشد. اگر سیستمی بتواند توضیح دهد چرا سرعت را کم کرده، تغییر خط داده یا حق تقدم را واگذار کرده است، ارزیابی، اصلاح و حتی اعتبارسنجی آن در محیطهای ایمنیحساس سادهتر میشود. برای صنعتی که اغلب به تصمیمگیری جعبه سیاه متهم میشود، این نکته اصلاً جزئی نیست.
زمانبندی این اقدام هم معنادار است. OneVL کمی بعد از متنباز شدن Omnivoice، مدل تولید صوت شیائومی، معرفی شده و نشان میدهد این شرکت در چند حوزه مختلف جدیتر به سمت توسعه متنباز هوش مصنوعی حرکت میکند. این فقط انتشار کد برای جلب حسن نیت نیست. این یک پیام است. شیائومی میخواهد صدای بلندتری در گفتوگوی هوش مصنوعی داشته باشد و بهوضوح میبیند که تحرک هوشمند یکی از میدانهایی است که ارزش تصاحب دارد.
رقابت در حوزه رانندگی خودران و هوش مصنوعی تجسمیافته هر ماه شدیدتر میشود. غولهای فناوری، خودروسازان و استارتاپهای تخصصی همگی به دنبال همان هدف هستند: سیستمهایی که بتوانند دنیای فیزیکی را آنقدر خوب درک کنند که در آن بهصورت ایمن عمل کنند. با متنباز کردن OneVL، شیائومی فقط به این رقابت وارد نمیشود، بلکه تلاش میکند قواعد آن را شکل دهد.





نظر بگذارید
نظرات (3)
یعنی بالاخره دارن میرن سمت فهم علت و معلول، نه فقط دیدن تصویر؟ اگه عملی باشه، قدم بزرگیه... ولی هنوز باید دید تو خیابون چی میشه
این یکی اگه open-source بمونه، میتونه خیلی از تیمها رو جلو بندازه. مخصوصا بخش توضیحپذیریش که تو خودران خیلی مهمه
جالبه ولی یه کم بوی تبلیغ میده... اگه واقعاً از CoT بهتره و سریعتره، باید تو جاده واقعی هم ثابتش کنن نه فقط بنچمارک