OpenAI-এর o1 সিরিজ এবং DeepSeek-R1-এর অসাধারণ সাফল্য দ্ব্যর্থহীনভাবে বৃহৎ-স্কেল রিইনফোর্সমেন্ট লার্নিং (RL)-এর ক্ষমতাকে অত্যাধুনিক যুক্তির আচরণ তৈরি করতে এবং বৃহৎ ভাষা মডেলের (LLMs) ক্ষমতাকে উল্লেখযোগ্যভাবে উন্নত করতে প্রমাণ করেছে।

যাইহোক, এই যুগান্তকারী চিন্তার মডেলগুলির পিছনে মূল প্রশিক্ষণের পদ্ধতিগুলি প্রায়শই তাদের প্রযুক্তিগত প্রতিবেদনগুলিতে আবৃত থাকে। সাম্প্রতিক সম্প্রদায়ের প্রচেষ্টাগুলি প্রাথমিকভাবে গাণিতিক যুক্তির উপর দৃষ্টি নিবদ্ধ করেছে, ক্রস-ডোমেন সাধারণীকরণের চ্যালেঞ্জটি অনেকাংশে অনাবিষ্কৃত। অধিকন্তু, প্রেফারেন্স অপ্টিমাইজেশান (GRPO) থেকে রিইনফোর্সমেন্ট লার্নিং এর স্ট্যান্ডার্ড ট্রেনিং মিশ্র ডোমেন ডেটাসেটগুলির সাথে কাজ করার সময় পারফরম্যান্সের বাধা, নমুনার অদক্ষ ব্যবহার এবং বিশেষ যুক্তির দক্ষতা গড়ে তোলার ক্ষেত্রে অসুবিধার মতো সাধারণ সমস্যাগুলির দ্বারা জর্জরিত। এই চ্যালেঞ্জগুলি এলএলএমগুলির জন্য আরএল পদ্ধতিগুলির কার্যকর স্কেলিংকে জটিল করে তোলে।
এই সীমাবদ্ধতাগুলিকে মোকাবেলা করে, কুয়াইশোউতে কোয়াপিলট দলের গবেষকরা একটি নতুন শক্তিবৃদ্ধি শেখার কাঠামো প্রবর্তন করেছেন: দ্বি-পদক্ষেপ ইতিহাস-রিস্যাম্পলিং পলিসি অপ্টিমাইজেশান (SRPO). এই উদ্ভাবনী পদ্ধতিটি একাধিক মাত্রা জুড়ে উপরে উল্লিখিত প্রশিক্ষণ চ্যালেঞ্জগুলিকে পদ্ধতিগতভাবে মোকাবেলা করার জন্য ডিজাইন করা হয়েছে। দলটি প্রকাশ্যে তাদের প্রশিক্ষণ পদ্ধতির জটিলতার বিবরণ দিয়ে একটি প্রযুক্তিগত প্রতিবেদন প্রকাশ করেছে এবং এটি ওপেন সোর্স করেছে SRPO-Qwen-32B মডেল
উল্লেখ্য, এই কাজটি চিহ্নিত করে গণিত এবং কোড উভয় ডোমেনে একই সাথে ডিপসিক-আর1-জিরো-লেভেল পারফরম্যান্স অর্জনের প্রথম উদাহরণ. DeepSeek (Qwen2.5-32B)-এর মতো একই বেস মডেলের ব্যবহার করে এবং শুধুমাত্র একটি শক্তিবৃদ্ধি শেখার প্রশিক্ষণ পদ্ধতি ব্যবহার করে, SRPO AIME24 (50) এবং LiveCodeBench (41.6) বেঞ্চমার্কে চিত্তাকর্ষক ফলাফল অর্জন করেছে, DeepSeek-R1-Zero-32B-কে ছাড়িয়ে গেছে।
আশ্চর্যজনকভাবে, SRPO শুধুমাত্র এই স্তরের কর্মক্ষমতা অর্জন করে প্রশিক্ষণের এক দশমাংশ R1-শূন্য দ্বারা প্রয়োজনীয়।
ভ্যানিলা GRPO এর সাথে চ্যালেঞ্জ
তাদের প্রাথমিক তদন্তে, কোয়াপিলট দল স্ট্যান্ডার্ড GRPO অ্যালগরিদম নিয়ে পরীক্ষা-নিরীক্ষা করেছে। যাইহোক, তারা দ্রুত বাধার সম্মুখীন হয় যা মডেলটিকে পছন্দসই R1-Zero পারফরম্যান্স স্তরে পৌঁছাতে বাধা দেয়। এই বিষয় অন্তর্ভুক্ত:
- ডোমেনের মধ্যে অপ্টিমাইজেশানে দ্বন্দ্ব (গণিত বনাম কোড): গাণিতিক সমস্যাগুলি যুক্তির দীর্ঘ এবং আরও বিস্তারিত লাইন (লং CoT) প্রকাশ করে, যখন কোড ডেটা এটি করার একটি দুর্বল প্রবণতা প্রদর্শন করে। এই দুই ধরনের ডেটা সরাসরি মিশ্রিত করার ফলে সংঘর্ষ হয়, যার ফলে উভয় ডোমেনেই সর্বোত্তম কর্মক্ষমতা দেখা যায়।
- অনুরূপ গ্রুপ পুরষ্কারের কারণে প্রশিক্ষণের কার্যকারিতা হ্রাস পেয়েছে: GRPO অ্যালগরিদম বেনিফিট গণনা করার জন্য একটি নমুনাযুক্ত গোষ্ঠীর মধ্যে অ-শূন্য পুরস্কারের বৈচিত্রের উপর নির্ভর করে। যখন একটি গোষ্ঠীর মধ্যে লঞ্চ করা হয় তখন প্রায় অভিন্ন পুরষ্কার মান পাওয়া যায়, গণনা করা সুবিধা শূন্যের কাছাকাছি পৌঁছে যায়। যদি প্রশিক্ষণ গোষ্ঠীর একটি উল্লেখযোগ্য অংশ এই ঘটনাটি প্রদর্শন করে, তাহলে কার্যকর ঢাল অবদান ন্যূনতম হয়ে যায়, যা প্রশিক্ষণের কার্যকারিতা মারাত্মকভাবে হ্রাস করে।
- কর্মক্ষমতা প্রাক-স্যাচুরেশন: GRPO প্রশিক্ষণ বেঞ্চমার্ক মূল্যায়নে প্রাথমিক কর্মক্ষমতা স্তর এবং পুরষ্কার স্যাচুরেশন পূরণ করেছে। এই সমস্যাটি আংশিকভাবে অপর্যাপ্ত ডেটা মানের জন্য দায়ী করা হয়েছিল। যখন প্রশিক্ষণের ডেটাতে যথেষ্ট জটিলতা বা বৈচিত্র্যের অভাব থাকে, বিশেষ করে সহজ সমস্যাগুলির প্রাচুর্যের সাথে, মডেলটি রক্ষণশীলভাবে সহজ কাজগুলিতে তার কর্মক্ষমতা বজায় রাখার প্রবণতা রাখে, চ্যালেঞ্জিং সমস্যার জন্য প্রয়োজনীয় জটিল এবং গভীর যুক্তি বিকাশের ক্ষমতাকে বাধা দেয়।
দুই পর্বের প্রশিক্ষণ
গাণিতিক ডোমেন এবং কোডের মধ্যে প্রতিক্রিয়া দৈর্ঘ্যের অন্তর্নিহিত দ্বন্দ্বগুলিকে মোকাবেলা করার জন্য, কোয়াপিলট দল একটি দুই-পর্যায়ের প্রশিক্ষণ দৃষ্টান্ত বাস্তবায়ন করেছে:
- ধাপ 1: যুক্তির ক্ষমতা নিয়োগ করা: এই প্রাথমিক প্রশিক্ষণ পর্বটি একচেটিয়াভাবে চ্যালেঞ্জিং গাণিতিক ডেটার উপর দৃষ্টি নিবদ্ধ করে। মূল লক্ষ্য হল পরীক্ষার সময় মডেলের স্কেলকে সম্পূর্ণভাবে উদ্দীপিত করা, প্রতিফলিত বিরতি, ব্যাকট্র্যাকিং এবং ধাপে ধাপে পচনের মতো ক্ষমতার চাষ করা।
- ধাপ 2: দক্ষতার সমন্বয়: এই পর্যায়ে, কোড ডেটা প্রশিক্ষণ প্রক্রিয়ায় প্রবেশ করানো হয়। ফেজ 1-এ প্রতিষ্ঠিত লজিক বেসের উপর ভিত্তি করে, এই ধাপের লক্ষ্য হল কোডিং ক্ষমতাকে আরও উন্নত করা এবং ধীরে ধীরে পদ্ধতিগত চিন্তা করার ক্ষমতা, পুনরাবৃত্তি এবং পড়ার সরঞ্জামগুলিকে শক্তিশালী করা।
নির্দেশমূলক কৌশলগুলির তুলনামূলক বিশ্লেষণ
প্রতিক্রিয়া দৈর্ঘ্যের উপর বিভিন্ন প্রশিক্ষণ ডেটা কৌশলগুলির প্রভাব বিশ্লেষণ করা হয়েছিল, নিম্নলিখিত অন্তর্দৃষ্টিগুলি প্রকাশ করে:
- মিশ্র প্রশিক্ষণ: গণিত এবং কোড ডেটার সংমিশ্রণে প্রশিক্ষিত মডেলগুলি প্রতিক্রিয়া দৈর্ঘ্য এবং দুর্বল বেঞ্চমার্ক কর্মক্ষমতা সীমিত বৃদ্ধি দেখায়। যদিও গণিতের সমস্যাগুলি কিছু চিন্তার ধরণকে উদ্দীপিত করেছিল, কোড সমস্যাগুলি প্রায়শই সংক্ষিপ্ত, সরাসরি প্রতিক্রিয়ার দিকে পরিচালিত করে যা ন্যূনতম বিশ্লেষণ বা পূর্ব পরিকল্পনার সাথে তাত্ক্ষণিক কোড আউটপুটের উপর দৃষ্টি নিবদ্ধ করে।
- শুধুমাত্র গণিতে প্রশিক্ষণ: শুধুমাত্র গাণিতিক তথ্যের উপর প্রশিক্ষণের ফলে প্রতিক্রিয়ার দৈর্ঘ্য স্থিরভাবে বৃদ্ধি পায় এবং গাণিতিক ব্যবস্থায় চমৎকার কর্মক্ষমতা। গুরুত্বপূর্ণভাবে, তিনি শক্তিশালী এবং সাধারণীকরণযোগ্য চিন্তা করার ক্ষমতার চাষ করেছিলেন; প্রোগ্রামিং কাজগুলির মুখোমুখি হলে, মডেলটি বিস্তারিত, ধাপে ধাপে চিন্তা করার চেষ্টা করেছিল, যার মধ্যে গাণিতিক সমস্যা সমাধানের পদক্ষেপগুলি সাবধানে পরীক্ষা করা এবং পুনঃচেক করা ছিল।
- শুধুমাত্র কোডে প্রশিক্ষণ: যদিও তারা কোড পরিমাপের উপর উন্নত কর্মক্ষমতা দেখিয়েছে, সুস্পষ্ট চিন্তাভাবনার বিকাশ ছিল ন্যূনতম, এবং প্রতিক্রিয়া দৈর্ঘ্যে উল্লেখযোগ্য বৃদ্ধি অর্জন করা কঠিন প্রমাণিত হয়েছে। কোড এবং গণিত উভয় সমস্যার প্রতিক্রিয়া শুধুমাত্র গণিত-প্রশিক্ষণের তুলনায় উল্লেখযোগ্যভাবে ছোট ছিল, কোড সমাধানগুলি প্রায়শই উল্লেখযোগ্য ধাপে ধাপে যুক্তি বা প্রাথমিক বিশ্লেষণ ছাড়াই সরাসরি তৈরি হয়।
- পর্যায়ভুক্ত প্রশিক্ষণ: কোয়াপিলট দলের প্রস্তাবিত দুই-পদক্ষেপের প্রশিক্ষণ পদ্ধতি গাণিতিক এবং প্রোগ্রামিং উভয় ক্ষেত্রেই চমৎকার ফলাফল তৈরি করেছে। মডেলটি ধারাবাহিকভাবে গণিত সমস্যার জন্য বিশদ ধাপে ধাপে যুক্তি এবং প্রোগ্রামিং কাজের জন্য কাঠামোগত চিন্তাভাবনা তৈরি করেছে। উল্লেখযোগ্যভাবে, জটিল আচরণ আবির্ভূত হয়েছে, যেমন মডেল যা গাণিতিক যুক্তিতে সহায়তা করার জন্য স্বতঃস্ফূর্তভাবে কোড ব্যবহার করে।
ইতিহাস পুনরায় নমুনা
কোয়াপিলট দল দেখেছে যে প্রশিক্ষণের মাঝামাঝি থেকে দেরী পর্যায়ে, একটি ব্যাচের মধ্যে নমুনা নেওয়া গ্রুপগুলির প্রায় 50% অভিন্ন পুরষ্কার তৈরি করেছে। এটি প্রায়শই ঘটেছিল যখন মডেলটি সহজ সমস্যায় ধারাবাহিকভাবে সফল হয়েছিল, যার ফলে ন্যূনতম পুরস্কারের পরিবর্তনশীলতা এবং অদক্ষ গ্রেডিয়েন্ট আপডেট হয়।
এই অদক্ষতা মোকাবেলা করতে এবং গ্রেডিয়েন্ট সিগন্যালের গুণমান উন্নত করতে, তারা প্রবর্তন করেছিল ইতিহাস পুনরায় নমুনা. প্রশিক্ষণের সময়, তারা প্রতিটি সময়ের মধ্যে সমস্ত বিতরণের পুরষ্কার ফলাফল রেকর্ড করে। একটি সময়কালের শেষে, তারা নিম্নলিখিত মানদণ্ডের উপর ভিত্তি করে পরবর্তী যুগের জন্য ডেটাসেট তৈরি করেছে:
- ফিল্টারিং খুব সহজ উদাহরণ: নমুনা যেখানে সমস্ত লঞ্চের ফলে সঠিক উত্তর দেওয়া হয়েছিল সেগুলি বাদ দেওয়া হয়েছিল, কারণ তারা নীতির উন্নতির জন্য একটি তথ্যপূর্ণ সংকেত প্রদান করেনি।
- তথ্যমূলক উদাহরণ সংরক্ষণ করা হচ্ছে: মিশ্র ফলাফল (সঠিক এবং ভুল) বা সমস্ত ভুল ফলাফল সহ নমুনাগুলি বজায় রাখা হয়েছিল। এই নমুনাগুলি ইতিবাচক পুরষ্কার বৈচিত্র্য তৈরি করেছে, যা শূন্যহীন সুবিধা এবং কার্যকর ঢাল সংকেত নিশ্চিত করেছে। তদ্ব্যতীত, হার্ড নমুনা যেখানে বর্তমান সময়ের মধ্যে সমস্ত বিতরণ ভুল ছিল তাও ধরে রাখা হয়েছিল। যুক্তি হল যে প্রাথমিকভাবে চ্যালেঞ্জিং সমস্যাগুলি আপডেট করা নীতির জন্য তুলনামূলকভাবে সহজ হয়ে উঠতে পারে, এইভাবে পরবর্তী প্রশিক্ষণে কার্যকর গ্রেডিয়েন্ট তৈরি করে। এই কৌশলটি পাঠ্যক্রম শিক্ষার নীতির সাথে সারিবদ্ধ করে, এবং প্রশিক্ষণের দক্ষতা উন্নত করার জন্য ধীরে ধীরে মডেলটিকে গড়ে আরও বেশি চ্যালেঞ্জিং নমুনার কাছে প্রকাশ করে।
DAPO-তে প্রস্তাবিত গতিশীল নমুনা পদ্ধতির তুলনায়, ইতিহাস পুনঃনমুনাকরণ গণনীয় দক্ষতা উল্লেখযোগ্যভাবে উন্নত করেছে এবং এর ফলে আরও স্থিতিশীল প্রতিক্রিয়া দৈর্ঘ্য বৃদ্ধি পেয়েছে।
তথ্য
Kwaipilot টিম কোড অ্যান্ড ম্যাথের সর্বজনীনভাবে উপলব্ধ ডেটাসেটগুলিতে কঠোর ডেটা পরিষ্কার এবং ফিল্টারিং সম্পাদন করেছে৷ তারা অপ্রাসঙ্গিক ইউআরএল ফিল্টার করার জন্য হিউরিস্টিক নিয়ম প্রয়োগ করেছে, গোলমাল ডিজাইন করেছে এবং মূল ডেটাতে মূল ক্ষেত্রগুলির (মৌলিক প্রশ্ন এবং উত্তর) অখণ্ডতা নিশ্চিত করেছে। গাণিতিক ডেটাতে PRIME-এর ডেটা পরিষ্কার করার পদ্ধতি অনুসরণ করে, তারা বহু-অংশের প্রশ্নগুলি, বিশুদ্ধ প্রমাণ-ভিত্তিক সমস্যাগুলি এবং যেগুলির জন্য একটি ছবি বা টেবিল বোঝার প্রয়োজন ছিল সেগুলি সরিয়ে দিয়েছে৷ কোড ডেটার জন্য, তারা অ্যালগরিদমিক যুক্তিতে ফোকাস করে নির্দিষ্ট পরিবেশ, ফাইল I/O, বা নেটওয়ার্ক মিথস্ক্রিয়াগুলির উপর নির্ভরশীল সমস্যাগুলি বাদ দিয়েছে।
ডেটা গ্রহণের আগে, তারা উত্তরের নির্ভুলতা এবং সমাধানযোগ্যতা নিশ্চিত করতে গণিত এবং কোড উভয় সমস্যার জন্য সঠিকতা পরীক্ষা করে, ভুল বা অস্পষ্ট সমাধানগুলিকে বাদ দিয়ে। তারপরে তারা প্রতিটি সমস্যার অসুবিধাকে তাদের পাসের হার (Pass@k) এর উপর ভিত্তি করে সহজ, মাঝারি এবং কঠিন স্তরে ভাগ করে রেট করেছে।
পরীক্ষামূলক ফলাফল
এই বিভাগে SRPO পদ্ধতি ব্যবহার করে প্রাপ্ত পরীক্ষামূলক ফলাফলের বিবরণ রয়েছে। কোয়াপিলট দল প্রশিক্ষণের সময় পুরষ্কার এবং প্রতিক্রিয়ার দৈর্ঘ্যের মতো মেট্রিক্সের পরিবর্তনগুলি দেখার উপর দৃষ্টি নিবদ্ধ করেছিল।
প্রশিক্ষণ প্রক্রিয়া
উপরের চিত্রটি SRPO প্রশিক্ষণের সময় সম্পূর্ণ পুরস্কার বক্ররেখা এবং প্রতিক্রিয়া দৈর্ঘ্যের বক্ররেখা তুলে ধরে। প্রাথমিক পুরষ্কার বৃদ্ধি মালভূমিতে শুরু করার পরে, প্রশিক্ষণটি দ্বিতীয় পর্যায়ে চলে যায়। দ্বিতীয় পর্বের শুরুতে, একটি কোডে মডেলের পূর্ববর্তী প্রশিক্ষণের অভাবের কারণে মোট পুরষ্কার হ্রাস পেয়েছে এবং তারপর পরবর্তী প্রশিক্ষণের সময় পুরষ্কারে ক্রমাগত বৃদ্ধি পেয়েছে। কোড ডেটা অন্তর্ভুক্ত করা উল্লেখযোগ্যভাবে প্রতিক্রিয়া দৈর্ঘ্য বৃদ্ধি করেনি, যা তাদের প্রত্যাশার সাথে মিলে যায়। একই সময়ে, তুলনার ফলাফলগুলি মডেলের গাণিতিক ক্ষমতা এবং কোডিং ক্ষমতা উভয়েরই একটি অবিচ্ছিন্ন এবং স্থিতিশীল উন্নতি নির্দেশ করে এবং নতুন পদ্ধতির কার্যকারিতা প্রদর্শন করে।
বিশেষত, ইতিহাস পুনঃনমুনাকরণ নিশ্চিত করেছে যে প্রতিটি প্রশিক্ষণের ধাপে ঢাল আপডেটগুলি কার্যকর থাকে, সরাসরি তথ্যমূলক ঢালের অনুপাত বৃদ্ধি করে। এই উন্নত নমুনা দক্ষতা স্থির পুরষ্কার বৃদ্ধির দিকে পরিচালিত করে, পরিষ্কারভাবে পুনরায় নমুনা দেওয়ার কৌশল দ্বারা অর্জিত উন্নত প্রশিক্ষণ দক্ষতা দেখায়।
যুক্তিযুক্ত আচরণ
কোয়াপিলট দল তিনটি প্রতিনিধি প্রতিফলিত নিদর্শন চিহ্নিত করেছে: পুনঃপরীক্ষা, দ্বিধা এবং অনুসন্ধান। তারা পরিসংখ্যানগতভাবে এই নিদর্শনগুলি ধারণকারী প্রতিক্রিয়াগুলি বিশ্লেষণ করেছে এবং প্রতিটির জন্য গড় প্রতিক্রিয়া দৈর্ঘ্য রেকর্ড করেছে। RL প্রশিক্ষণের সময়, তারা স্ব-প্রতিফলন, সংশোধন এবং মডেলের বিপরীতের ফ্রিকোয়েন্সিতে ধীরে ধীরে বৃদ্ধি লক্ষ্য করে, যা “স্ব-যাচাই” ক্ষমতার উত্থানের ইঙ্গিত দেয়। তারা যুক্তি দেয় যে RL এর সময় মডেলে মানব জ্ঞানীয় প্রক্রিয়ার অনুরূপ “প্রতিফলন” এর আবির্ভাব নীতি অপ্টিমাইজেশন প্রক্রিয়ার ফলে একটি অভিযোজিত আচরণ।
উপরের চিত্রে যেমন দেখানো হয়েছে, প্রশিক্ষণের প্রাথমিক পর্যায়ে মডেলটিতে প্রোঅ্যাকটিভ টেস্টিং এবং পূর্ববর্তী চিন্তার পর্যায়গুলির প্রতিফলন খুব কমই দেখানো হয়েছে। যাইহোক, প্রশিক্ষণের অগ্রগতির সাথে সাথে, মডেলটি উল্লেখযোগ্য প্রতিফলিত এবং ট্র্যাকিং আচরণ প্রদর্শন করে, প্রতিক্রিয়ার ধরণ যেমন ধাপে ধাপে চিন্তাভাবনা, সংখ্যাসূচক প্রতিস্থাপন, ধাপে ধাপে যাচাইকরণ এবং স্ব-অপ্টিমাইজেশন তৈরি করে।
মজার বিষয় হল, তারা আরও দেখেছে যে মডেলটি গাণিতিক সমস্যা সমাধানের সময় যাচাইয়ের জন্য স্বতঃস্ফূর্তভাবে প্রোগ্রাম কোড ব্যবহার করতে শিখেছে। এটি প্রথমে গাণিতিক যুক্তি ব্যবহার করে একটি সমাধান প্রক্রিয়া প্রদান করবে এবং তারপর সমাধানের সঠিকতা যাচাই করার জন্য সক্রিয়ভাবে প্রোগ্রাম কোড লিখবে। এই কেসগুলি স্ব-সংশোধন এবং একাধিক প্রচেষ্টার জন্য পদ্ধতিগত চিন্তাভাবনাকে কাজে লাগানোর মডেলের ক্ষমতা প্রদর্শন করে এবং আরও ইঙ্গিত দেয় যে প্রশিক্ষণের পরবর্তী পর্যায়ে, মডেলটি বিস্তৃত চিন্তাভাবনা এবং সমস্যা সমাধানের জন্য বিভিন্ন কোড-ভিত্তিক চিন্তা পদ্ধতির সমন্বিত প্রয়োগকে আয়ত্ত করেছে।
এসআরপিও নথি: এলএলএম-এ বড় আকারের শক্তিবৃদ্ধি শিক্ষার ক্রস-ডোমেন বাস্তবায়ন arXiv
SRPO-Qwen-32B দিয়ে চেষ্টা করুন HuggingFace এ মডেল
The post GRPO কি ১০ গুণ বেশি কার্যকর হতে পারে? Kwai AI এর SRPO SRPO এর সাথে হ্যাঁ প্রস্তাব appeared first on Synced.
Source link