স্ব-উন্নত AI-এর ধারণা সাম্প্রতিক গবেষণার বৃত্তে একটি আলোচিত বিষয় হয়ে দাঁড়িয়েছে, যেখানে প্রচুর কাগজপত্র প্রকাশিত হয়েছে এবং স্ব-বিকশিত বুদ্ধিমান সিস্টেমের ভবিষ্যত বিবেচনা করে OpenAI CEO স্যাম অল্টম্যানের মতো বিশিষ্ট ব্যক্তিরা। এখন, এমআইটি থেকে একটি নতুন গবেষণাপত্র, “সেলফ-অ্যাডাপ্টিভ ল্যাঙ্গুয়েজ মডেলস,” উপস্থাপন করে সিল (স্ব-গতিসম্পন্ন এলএলএম অধ্যয়ন)একটি অভিনব কাঠামো যা বড় ভাষা মডেল (LLMs) কে তাদের ওজন আপডেট করতে দেয়। এই উন্নয়নকে সত্যিকারের স্ব-বিকশিত এআই-এর উপলব্ধির দিকে আরেকটি উল্লেখযোগ্য পদক্ষেপ হিসেবে দেখা হয়।
গতকাল প্রকাশিত গবেষণাপত্রটি হ্যাকার নিউজ সহ ইতিমধ্যে বেশ আলোচনার জন্ম দিয়েছে। SEAL একটি পদ্ধতি অফার করে যেখানে LLM “স্ব-সম্পাদনা” ব্যবহার করে তার নিজস্ব প্রশিক্ষণ ডেটা তৈরি করতে পারে এবং তারপরে নতুন ইনপুটগুলির উপর ভিত্তি করে এর ওজন আপডেট করতে পারে। অত্যন্ত গুরুত্বপূর্ণভাবে, এই স্ব-সম্পাদনা প্রক্রিয়াটি রিইনফোর্সমেন্ট লার্নিং এর মাধ্যমে শেখা হয়, আপডেট করা ডাউনস্ট্রিম মডেলের কর্মক্ষমতার সাথে পুরষ্কার প্রক্রিয়ার সাথে যুক্ত।
এআই স্ব-উন্নয়নের বিষয়ে সাম্প্রতিক আগ্রহের কারণে এই নিবন্ধের সময় বিশেষভাবে উল্লেখযোগ্য। এই মাসের শুরুতে, সাকানা এআই এবং ইউনিভার্সিটি অফ ব্রিটিশ কলাম্বিয়ার ডারউইন-গোডেল মেশিন (ডিজিএম), সিএমইউ-এর স্ব-পুরস্কার প্রশিক্ষণ (এসআরটি), সাংহাই জিয়াও টং ইউনিভার্সিটির MM-UPT ফ্রেমওয়ার্ক বৃহৎ মাল্টিমডাল মডেলগুলিতে ক্রমাগত স্ব-উন্নতির জন্য এবং এইচইউআই-উআই-উআই-উআই-উআই-উআইজি-তে সহ অন্যান্য গবেষণা প্রচেষ্টা মনোযোগ আকর্ষণ করেছে। আত্মসহযোগিতা
গুঞ্জন ছাড়াও, ওপেনএআই সিইও স্যাম অল্টম্যান সম্প্রতি তার ব্লগ পোস্ট “দ্য জেন্টেল সিঙ্গুলারিটি”-তে কৃত্রিম বুদ্ধিমত্তা এবং স্ব-উন্নতিকারী রোবটগুলির সাথে ভবিষ্যতের জন্য তার দৃষ্টিভঙ্গি শেয়ার করেছেন। তিনি যুক্তি দিয়েছিলেন যে লক্ষ লক্ষ হিউম্যানয়েড রোবটের প্রথাগত উত্পাদনের প্রয়োজন হবে, তারপরে তারা “আরো রোবট তৈরি করতে পুরো সাপ্লাই চেইনকে সক্রিয় করতে পারে, যার ফলে আরও চিপ উত্পাদন সুবিধা, ডেটা সেন্টার এবং আরও অনেক কিছু তৈরি করা যেতে পারে।” এটি দ্রুত @VraserX-এর কাছ থেকে একটি টুইট করার প্ররোচনা দেয়, যিনি দাবি করেছিলেন যে একটি OpenAI অভ্যন্তরীণ ব্যক্তি প্রকাশ করেছে যে সংস্থাটি ইতিমধ্যেই পুনরাবৃত্তভাবে স্ব-উন্নত AI চালাচ্ছে, একটি দাবি যা এর সত্যতা সম্পর্কে ব্যাপক বিতর্কের জন্ম দিয়েছে।
OpenAI-এর অভ্যন্তরীণ উন্নয়নের সুনির্দিষ্টতা নির্বিশেষে, SEAL-এর MIT পেপার স্ব-বিবর্তনের দিকে AI-এর অগ্রগতির সুনির্দিষ্ট প্রমাণ প্রদান করে।
সিল বোঝা: স্ব-অভিযোজিত ভাষা মডেল
SEAL-এর পিছনে মূল ধারণা হল ভাষা মডেলগুলিকে নিজেদের উন্নত করার অনুমতি দেওয়া যখন তারা তাদের নিজস্ব সিন্থেটিক ডেটা তৈরি করে এবং স্ব-সম্পাদনার মাধ্যমে তাদের পরামিতিগুলিকে অপ্টিমাইজ করে নতুন ডেটার সম্মুখীন হয়। মডেলকে প্রশিক্ষণের উদ্দেশ্য হল মডেলের প্রসঙ্গে প্রদত্ত ডেটা ব্যবহার করে সরাসরি এই স্ব-অনুমান (SE) তৈরি করা।
এই স্ব-সম্পাদনাগুলির সৃষ্টি শক্তিবৃদ্ধি শিক্ষার মাধ্যমে শেখা হয়। মডেলটিকে পুরস্কৃত করা হয় যখন তৈরি করা স্ব-সম্পাদনা, বাস্তবায়নের পরে, লক্ষ্য টাস্কে উন্নত কর্মক্ষমতার দিকে নিয়ে যায়। অতএব, SEAL কে দুটি নেস্টেড লুপ সহ একটি অ্যালগরিদম হিসাবে ধারণা করা যেতে পারে: একটি আউটার লার্নিং (RL) লুপ যা eigenvalues এর জেনারেশনকে অপ্টিমাইজ করে এবং একটি অভ্যন্তরীণ আপডেট লুপ যা গ্রেডিয়েন্ট ডিসেন্টের মাধ্যমে মডেল আপডেট করার জন্য জেনারেট করা eigenvalues ব্যবহার করে।
এই পদ্ধতিটিকে মেটা-লার্নিং-এর উদাহরণ হিসাবে দেখা যেতে পারে, যেখানে ফোকাস মেটা-লার্নিং পদ্ধতিতে কীভাবে কার্যকর স্ব-সম্পাদনা তৈরি করা যায় তার উপর।
সাধারণ কাঠামো
SEAL একটি একক টাস্ক ইনস্ট্যান্স (C,τ), যেখানে সি হল টাস্ক-প্রাসঙ্গিক প্রসঙ্গ তথ্য, এবং τ মডেলের ফিট মূল্যায়নের জন্য ডাউনস্ট্রিম মূল্যায়নকারীকে সংজ্ঞায়িত করে। উদাহরণস্বরূপ, একটি জ্ঞান একীকরণ কার্যে, C মডেলের অভ্যন্তরীণ জ্ঞানের সাথে একীভূত করার জন্য একটি সেগমেন্ট হতে পারে এবং τ সেই বিভাগ সম্পর্কে প্রশ্নগুলির একটি সেট।
C দেওয়া হয়েছে, মডেলটি একটি স্ব-সম্পাদনা SE তৈরি করে, যা পরে তার পরামিতিগুলিকে তত্ত্বাবধানে থাকা ফাইন-টিউনিংয়ের মাধ্যমে আপডেট করে: θ′←SFT(θ,SE)। এই স্ব-সম্পাদনা প্রজন্মকে অপ্টিমাইজ করতে রিইনফোর্সমেন্ট লার্নিং ব্যবহার করা হয়: মডেলটি একটি ক্রিয়া সম্পাদন করে (একটি SE তৈরি করে), τ-এ LMθ′ এর পারফরম্যান্সের উপর ভিত্তি করে একটি পুরষ্কার r পায়, এবং প্রত্যাশিত পুরষ্কার সর্বাধিক করার জন্য তার নীতি আপডেট করে৷
গবেষকরা দেখেছেন যে জিআরপিও এবং পিপিওর মতো ঐতিহ্যগত অনলাইন নীতি পদ্ধতিগুলি অস্থির প্রশিক্ষণের দিকে পরিচালিত করে। তারা ডিপমাইন্ড পেপার থেকে ফিল্টারিং এর উপর ভিত্তি করে REST^EM, একটি সহজ আচরণগত ক্লোনিং পদ্ধতি বেছে নিয়েছে। এই পদ্ধতিটিকে একটি এক্সপেক্টেশন ম্যাক্সিমাইজেশন (EM) প্রক্রিয়া হিসাবে দেখা যেতে পারে, যেখানে বর্তমান মডেল নীতি থেকে ই-পদক্ষেপের নমুনা প্রার্থীর আউটপুট, এবং M-স্টেপ শুধুমাত্র সেই নমুনাগুলিকে শক্তিশালী করে যেগুলি তত্ত্বাবধানে সূক্ষ্ম-টিউনিংয়ের মাধ্যমে একটি ইতিবাচক পুরস্কার দেয়।
নিবন্ধটি আরও উল্লেখ করেছে যে বর্তমান বাস্তবায়ন স্ব-মূল্যায়ন তৈরি এবং শেখার জন্য একটি একক মডেল ব্যবহার করে, এই ভূমিকাগুলি “শিক্ষক-ছাত্র” সেটআপে আলাদা করা যেতে পারে।
নির্দিষ্ট ডোমেনে একটি SEAL তৈরি করা
এমআইটি দল দুটি নির্দিষ্ট এলাকায় সিল তৈরি করেছে: জ্ঞান একীকরণ এবং কয়েক শট শেখা.
- জ্ঞান একীকরণ: এখানে লক্ষ্য হল মডেলের ওজনে নিবন্ধ থেকে তথ্যকে দক্ষতার সাথে একত্রিত করা।
- কিছু শট শেখা: এটি খুব কম উদাহরণ সহ মডেলটিকে নতুন কাজের সাথে মানিয়ে নেওয়া জড়িত।
পরীক্ষামূলক ফলাফল
স্পার্স লার্নিং এবং জ্ঞান একীকরণ উভয়ের জন্য পরীক্ষামূলক ফলাফল SEAL কাঠামোর কার্যকারিতা প্রদর্শন করে।
অন কয়েক শট শেখাLlama-3.2-1B-ইনস্ট্রাক্ট মডেল ব্যবহার করে, SEAL অভিযোজন সাফল্যের হার উল্লেখযোগ্যভাবে উন্নত করেছে, RL প্রশিক্ষণ ছাড়া মৌলিক স্ব-সম্পাদনা ব্যবহার করে মডেলগুলির জন্য 20% এবং অভিযোজন ছাড়া 0% এর তুলনায় 72.5% অর্জন করেছে। যদিও এখনও “ওরাকল টিটিটি” (আদর্শ বেসলাইন) এর নিচে, এটি উল্লেখযোগ্য অগ্রগতি নির্দেশ করে।
জন্য জ্ঞান একীকরণSQuAD নিবন্ধগুলি থেকে নতুন তথ্যগুলিকে অন্তর্ভুক্ত করার জন্য একটি বড় Qwen2.5-7B মডেল ব্যবহার করে, SEAL ধারাবাহিকভাবে বেসলাইন পদ্ধতিগুলিকে ছাড়িয়ে যেতে সক্ষম হয়েছিল৷ বেস Qwen-2.5-7B মডেল থেকে কৃত্রিমভাবে উত্পন্ন ডেটা সহ প্রশিক্ষণ ইতিমধ্যেই উল্লেখযোগ্য উন্নতি দেখায়, এবং পরবর্তী শক্তিবৃদ্ধি শেখার ফলে কর্মক্ষমতা আরও বৃদ্ধি পায়। বাহ্যিক RL পুনরাবৃত্তির তুলনায় নির্ভুলতাও দ্রুত উন্নতি দেখায়, প্রায়শই GPT-4.1 জেনারেটেড ডেটা ব্যবহার করে মাত্র দুটি পুনরাবৃত্তিতে সেটিংসকে ছাড়িয়ে যায়।
নিবন্ধের গুণগত উদাহরণগুলি ব্যাখ্যা করে যে কীভাবে শক্তিবৃদ্ধি শিক্ষা আরও বিস্তারিত স্ব-সম্পাদনা তৈরির দিকে নিয়ে যায়, যার ফলে কর্মক্ষমতা উন্নত হয়।
যদিও প্রতিশ্রুতিশীল, গবেষকরা SEAL ফ্রেমওয়ার্কের কিছু সীমাবদ্ধতাও স্বীকার করেন, যার মধ্যে বিপর্যয়মূলক ভুলে যাওয়া, কম্পিউটেশনাল ওভারহেড এবং প্রসঙ্গ-নির্ভর মূল্যায়ন সম্পর্কিত দিকগুলি রয়েছে। মূল নিবন্ধে এগুলি বিস্তারিতভাবে আলোচনা করা হয়েছে।
মূল কাগজ: https://arxiv.org/pdf/2506.10943
প্রকল্পের ওয়েবসাইট: https://jyopari.github.io/posts/seal
গিথুব রেপো: https://github.com/Continuous-Intelligence/SEAL
The post এমআইটি গবেষকরা ‘সাইন’ উন্মোচন করেছেন: স্ব-উন্নতি কৃত্রিম বুদ্ধিমত্তার দিকে একটি নতুন পদক্ষেপ appeared first on Synced.
Source link