বেশিরভাগ বর্তমান ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (ভিএলএ) মডেলগুলি-যেমন ওপেনভিএলএ, π0, আরটি-2, এবং আরডিটি-1বি- “একচেটিয়া”। এর মানে হল যে তারা অশোধিত মোটর কমান্ড বা কর্মের খুব ছোট ক্রম তৈরি করে, সুসংজ্ঞায়িত এবং পুনরায় ব্যবহারযোগ্য আচরণগুলি সংগঠিত না করে। ফলস্বরূপ, এই মডেলগুলি দীর্ঘমেয়াদী (মাল্টি-স্টেপ) কাজগুলিতে খারাপভাবে সম্পাদন করে এবং তারা যা শিখেছে তা ব্যাখ্যা করা কঠিন। দক্ষতা আবিষ্কারের বিদ্যমান পন্থাগুলি প্রায়শই সিদ্ধান্ত নেওয়ার মূল সমস্যা এড়িয়ে যায় যখন দুটি অ্যাকশন সিকোয়েন্স “আচরণগতভাবে সমতুল্য” হয়। উদাহরণস্বরূপ, AtomicVLA এবং AtomSkill গ্রুপ অ্যাকশন সিকোয়েন্স তাদের বিপরীত এমবেডিং গ্রুপ করে। বিপরীতে, BLADE এবং LRLL দুটি সিকোয়েন্স সমান কিনা তা বিচার করার জন্য একটি বৃহৎ ভাষা মডেল (LLM) এর উপর নির্ভর করে, কিন্তু এই LLMগুলি রোবটের গতিশীলতার সাথে ক্রমাঙ্কিত হয় না। আমরা উপস্থাপন করছি REFACTOR-VLA, এমন একটি সিস্টেম যা একটি “জাগ্রত/ঘুম” আর্কিটেকচার ব্যবহার করে পুনরায় ব্যবহারযোগ্য দক্ষতা শেখে। ঘুমের পর্যায়ে, সিস্টেম বিহেভিওরাল-ইকুইভালেন্স কার্নেল (BEK) ব্যবহার করে মোটর প্রোগ্রামের অংশগুলিকে গোষ্ঠীভুক্ত করে। এই BEK একটি শেখা প্রচ্ছন্ন বিশ্ব মডেল, Mφ-এ অপারেশন চালানোর ফলাফলের উপর ভিত্তি করে। জেগে ওঠার পর্যায়ে, সিস্টেমটি হিন্ডলি-মিলনার সিস্টেম দ্বারা অনুপ্রাণিত একটি শব্দভাণ্ডার থেকে টাইপ করা ল্যাম্বডা পদ (সরল এবং কাঠামোগত প্রোগ্রাম) তৈরি করে। এই ল্যাম্বডা পদগুলি তখন লাইব্রেরিতে শর্তসাপেক্ষ পরিবর্তিত ফ্লো অপারেশন ডিকোডার দ্বারা অপারেশন তৈরি করতে ব্যবহার করা হয়। শুধুমাত্র সরলীকরণ যা ন্যূনতম বর্ণনা দৈর্ঘ্য (MDL) মানদণ্ড এবং একটি পুনরাবৃত্তি সংরক্ষণ গেট উভয়ই পাস করে দক্ষতা হিসাবে গ্রহণ করা হয়। REFACTOR-VLA প্রশিক্ষণের জন্য, আমরা একটি তিন-পর্যায়ের সময়সূচী ব্যবহার করি: • ফেজ A (ওয়ার্ল্ড মডেল ওয়ার্ম-আপ): সুপ্ত বিশ্ব মডেল Mφ প্রশিক্ষিত। • ফেজ বি (ওয়েক-ফেজ পলিসি অপ্টিমাইজেশান): দক্ষতা লাইব্রেরি ব্যবহার করে নীতি অপ্টিমাইজ করা হয়। • পর্যায় সি (ঘুমের পর্যায়ে দক্ষতার আবিষ্কার): সিস্টেমটি পুনরায় ব্যবহারযোগ্য দক্ষতায় ক্রিয়াকলাপের অংশগুলিকে গোষ্ঠীভুক্ত করে। আমরা সম্পূর্ণ LIBERO বেঞ্চমার্ক স্যুটে REFACTOR-VLA মূল্যায়ন করেছি। আমাদের ফলাফল দুটি প্রধান ফলাফল দেখায়। প্রথমত, কেবলমাত্র গ্লোবাল মডেলের আকার বৃদ্ধি করা – 188 মিলিয়ন থেকে 430 মিলিয়ন প্যারামিটারে – 4টি বেঞ্চমার্ক স্যুটের মধ্যে 4টির কর্মক্ষমতাকে খারাপ করেছে, এই ধারণাটিকে অস্বীকার করে যে বিশ্বব্যাপী মডেলটিকে আরও বড় করে তোলা সর্বদা সাহায্য করে৷ দ্বিতীয়ত, প্রশিক্ষণের লক্ষ্য পরিবর্তন করা একটি বড় পার্থক্য করে: গ্লোবাল মডেলের (ফেজ A) ওয়ার্ম-আপের সময় সহায়ক তত্ত্বাবধানে বৈপরীত্য ক্ষতি (বিশেষত, ইনফোএনসিই ক্ষতি) যোগ করা ঘুমের পর্যায়ে (ফেজ সি) সময় দক্ষতা সেটের গুণমানকে ব্যাপকভাবে উন্নত করে। আমরা n = 3 মাল্টিসিডিংয়ের অধীনে স্বাভাবিক পারস্পরিক তথ্য (NMI) ব্যবহার করে এটি পরিমাপ করেছি: • অবজেক্ট বান্ডেল: 0.462 ± 0.021 • স্থানিক বান্ডেল: 0.867 ± 0.025 • লক্ষ্য বান্ডিল: 0.915 ± 0.013 • LIBERO-10.4±4.5.4±