এমআইটি গবেষকরা “সিল” উন্মোচন করেছেন: স্ব-উন্নতি AI এর দিকে একটি নতুন পদক্ষেপ


স্ব-উন্নত AI-এর ধারণা সাম্প্রতিক গবেষণার বৃত্তে একটি আলোচিত বিষয় হয়ে দাঁড়িয়েছে, যেখানে প্রচুর কাগজপত্র প্রকাশিত হয়েছে এবং স্ব-বিকশিত বুদ্ধিমান সিস্টেমের ভবিষ্যত বিবেচনা করে OpenAI CEO স্যাম অল্টম্যানের মতো বিশিষ্ট ব্যক্তিরা। এখন, এমআইটি থেকে একটি নতুন গবেষণাপত্র, “সেলফ-অ্যাডাপ্টিভ ল্যাঙ্গুয়েজ মডেলস,” উপস্থাপন করে সিল (স্ব-গতিসম্পন্ন এলএলএম অধ্যয়ন)একটি অভিনব কাঠামো যা বড় ভাষা মডেল (LLMs) কে তাদের ওজন আপডেট করতে দেয়। এই উন্নয়নকে সত্যিকারের স্ব-বিকশিত এআই-এর উপলব্ধির দিকে আরেকটি উল্লেখযোগ্য পদক্ষেপ হিসেবে দেখা হয়।

গতকাল প্রকাশিত গবেষণাপত্রটি হ্যাকার নিউজ সহ ইতিমধ্যে বেশ আলোচনার জন্ম দিয়েছে। SEAL একটি পদ্ধতি অফার করে যেখানে LLM “স্ব-সম্পাদনা” ব্যবহার করে তার নিজস্ব প্রশিক্ষণ ডেটা তৈরি করতে পারে এবং তারপরে নতুন ইনপুটগুলির উপর ভিত্তি করে এর ওজন আপডেট করতে পারে। অত্যন্ত গুরুত্বপূর্ণভাবে, এই স্ব-সম্পাদনা প্রক্রিয়াটি রিইনফোর্সমেন্ট লার্নিং এর মাধ্যমে শেখা হয়, আপডেট করা ডাউনস্ট্রিম মডেলের কর্মক্ষমতার সাথে পুরষ্কার প্রক্রিয়ার সাথে যুক্ত।

এমআইটি গবেষকরা “সিল” উন্মোচন করেছেন: স্ব-উন্নতি AI এর দিকে একটি নতুন পদক্ষেপ

এআই স্ব-উন্নয়নের বিষয়ে সাম্প্রতিক আগ্রহের কারণে এই নিবন্ধের সময় বিশেষভাবে উল্লেখযোগ্য। এই মাসের শুরুতে, সাকানা এআই এবং ইউনিভার্সিটি অফ ব্রিটিশ কলাম্বিয়ার ডারউইন-গোডেল মেশিন (ডিজিএম), সিএমইউ-এর স্ব-পুরস্কার প্রশিক্ষণ (এসআরটি), সাংহাই জিয়াও টং ইউনিভার্সিটির MM-UPT ফ্রেমওয়ার্ক বৃহৎ মাল্টিমডাল মডেলগুলিতে ক্রমাগত স্ব-উন্নতির জন্য এবং এইচইউআই-উআই-উআই-উআই-উআই-উআইজি-তে সহ অন্যান্য গবেষণা প্রচেষ্টা মনোযোগ আকর্ষণ করেছে। আত্মসহযোগিতা

গুঞ্জন ছাড়াও, ওপেনএআই সিইও স্যাম অল্টম্যান সম্প্রতি তার ব্লগ পোস্ট “দ্য জেন্টেল সিঙ্গুলারিটি”-তে কৃত্রিম বুদ্ধিমত্তা এবং স্ব-উন্নতিকারী রোবটগুলির সাথে ভবিষ্যতের জন্য তার দৃষ্টিভঙ্গি শেয়ার করেছেন। তিনি যুক্তি দিয়েছিলেন যে লক্ষ লক্ষ হিউম্যানয়েড রোবটের প্রথাগত উত্পাদনের প্রয়োজন হবে, তারপরে তারা “আরো রোবট তৈরি করতে পুরো সাপ্লাই চেইনকে সক্রিয় করতে পারে, যার ফলে আরও চিপ উত্পাদন সুবিধা, ডেটা সেন্টার এবং আরও অনেক কিছু তৈরি করা যেতে পারে।” এটি দ্রুত @VraserX-এর কাছ থেকে একটি টুইট করার প্ররোচনা দেয়, যিনি দাবি করেছিলেন যে একটি OpenAI অভ্যন্তরীণ ব্যক্তি প্রকাশ করেছে যে সংস্থাটি ইতিমধ্যেই পুনরাবৃত্তভাবে স্ব-উন্নত AI চালাচ্ছে, একটি দাবি যা এর সত্যতা সম্পর্কে ব্যাপক বিতর্কের জন্ম দিয়েছে।

OpenAI-এর অভ্যন্তরীণ উন্নয়নের সুনির্দিষ্টতা নির্বিশেষে, SEAL-এর MIT পেপার স্ব-বিবর্তনের দিকে AI-এর অগ্রগতির সুনির্দিষ্ট প্রমাণ প্রদান করে।

সিল বোঝা: স্ব-অভিযোজিত ভাষা মডেল

SEAL-এর পিছনে মূল ধারণা হল ভাষা মডেলগুলিকে নিজেদের উন্নত করার অনুমতি দেওয়া যখন তারা তাদের নিজস্ব সিন্থেটিক ডেটা তৈরি করে এবং স্ব-সম্পাদনার মাধ্যমে তাদের পরামিতিগুলিকে অপ্টিমাইজ করে নতুন ডেটার সম্মুখীন হয়। মডেলকে প্রশিক্ষণের উদ্দেশ্য হল মডেলের প্রসঙ্গে প্রদত্ত ডেটা ব্যবহার করে সরাসরি এই স্ব-অনুমান (SE) তৈরি করা।

এই স্ব-সম্পাদনাগুলির সৃষ্টি শক্তিবৃদ্ধি শিক্ষার মাধ্যমে শেখা হয়। মডেলটিকে পুরস্কৃত করা হয় যখন তৈরি করা স্ব-সম্পাদনা, বাস্তবায়নের পরে, লক্ষ্য টাস্কে উন্নত কর্মক্ষমতার দিকে নিয়ে যায়। অতএব, SEAL কে দুটি নেস্টেড লুপ সহ একটি অ্যালগরিদম হিসাবে ধারণা করা যেতে পারে: একটি আউটার লার্নিং (RL) লুপ যা eigenvalues ​​এর জেনারেশনকে অপ্টিমাইজ করে এবং একটি অভ্যন্তরীণ আপডেট লুপ যা গ্রেডিয়েন্ট ডিসেন্টের মাধ্যমে মডেল আপডেট করার জন্য জেনারেট করা eigenvalues ​​ব্যবহার করে।

এই পদ্ধতিটিকে মেটা-লার্নিং-এর উদাহরণ হিসাবে দেখা যেতে পারে, যেখানে ফোকাস মেটা-লার্নিং পদ্ধতিতে কীভাবে কার্যকর স্ব-সম্পাদনা তৈরি করা যায় তার উপর।

সাধারণ কাঠামো

SEAL একটি একক টাস্ক ইনস্ট্যান্স (C,τ), যেখানে সি হল টাস্ক-প্রাসঙ্গিক প্রসঙ্গ তথ্য, এবং τ মডেলের ফিট মূল্যায়নের জন্য ডাউনস্ট্রিম মূল্যায়নকারীকে সংজ্ঞায়িত করে। উদাহরণস্বরূপ, একটি জ্ঞান একীকরণ কার্যে, C মডেলের অভ্যন্তরীণ জ্ঞানের সাথে একীভূত করার জন্য একটি সেগমেন্ট হতে পারে এবং τ সেই বিভাগ সম্পর্কে প্রশ্নগুলির একটি সেট।

C দেওয়া হয়েছে, মডেলটি একটি স্ব-সম্পাদনা SE তৈরি করে, যা পরে তার পরামিতিগুলিকে তত্ত্বাবধানে থাকা ফাইন-টিউনিংয়ের মাধ্যমে আপডেট করে: θ′←SFT(θ,SE)। এই স্ব-সম্পাদনা প্রজন্মকে অপ্টিমাইজ করতে রিইনফোর্সমেন্ট লার্নিং ব্যবহার করা হয়: মডেলটি একটি ক্রিয়া সম্পাদন করে (একটি SE তৈরি করে), τ-এ LMθ′ এর পারফরম্যান্সের উপর ভিত্তি করে একটি পুরষ্কার r পায়, এবং প্রত্যাশিত পুরষ্কার সর্বাধিক করার জন্য তার নীতি আপডেট করে৷

গবেষকরা দেখেছেন যে জিআরপিও এবং পিপিওর মতো ঐতিহ্যগত অনলাইন নীতি পদ্ধতিগুলি অস্থির প্রশিক্ষণের দিকে পরিচালিত করে। তারা ডিপমাইন্ড পেপার থেকে ফিল্টারিং এর উপর ভিত্তি করে REST^EM, একটি সহজ আচরণগত ক্লোনিং পদ্ধতি বেছে নিয়েছে। এই পদ্ধতিটিকে একটি এক্সপেক্টেশন ম্যাক্সিমাইজেশন (EM) প্রক্রিয়া হিসাবে দেখা যেতে পারে, যেখানে বর্তমান মডেল নীতি থেকে ই-পদক্ষেপের নমুনা প্রার্থীর আউটপুট, এবং M-স্টেপ শুধুমাত্র সেই নমুনাগুলিকে শক্তিশালী করে যেগুলি তত্ত্বাবধানে সূক্ষ্ম-টিউনিংয়ের মাধ্যমে একটি ইতিবাচক পুরস্কার দেয়।

নিবন্ধটি আরও উল্লেখ করেছে যে বর্তমান বাস্তবায়ন স্ব-মূল্যায়ন তৈরি এবং শেখার জন্য একটি একক মডেল ব্যবহার করে, এই ভূমিকাগুলি “শিক্ষক-ছাত্র” সেটআপে আলাদা করা যেতে পারে।

নির্দিষ্ট ডোমেনে একটি SEAL তৈরি করা

এমআইটি দল দুটি নির্দিষ্ট এলাকায় সিল তৈরি করেছে: জ্ঞান একীকরণ এবং কয়েক শট শেখা.

  • জ্ঞান একীকরণ: এখানে লক্ষ্য হল মডেলের ওজনে নিবন্ধ থেকে তথ্যকে দক্ষতার সাথে একত্রিত করা।
  • কিছু শট শেখা: এটি খুব কম উদাহরণ সহ মডেলটিকে নতুন কাজের সাথে মানিয়ে নেওয়া জড়িত।

পরীক্ষামূলক ফলাফল

স্পার্স লার্নিং এবং জ্ঞান একীকরণ উভয়ের জন্য পরীক্ষামূলক ফলাফল SEAL কাঠামোর কার্যকারিতা প্রদর্শন করে।

অন কয়েক শট শেখাLlama-3.2-1B-ইনস্ট্রাক্ট মডেল ব্যবহার করে, SEAL অভিযোজন সাফল্যের হার উল্লেখযোগ্যভাবে উন্নত করেছে, RL প্রশিক্ষণ ছাড়া মৌলিক স্ব-সম্পাদনা ব্যবহার করে মডেলগুলির জন্য 20% এবং অভিযোজন ছাড়া 0% এর তুলনায় 72.5% অর্জন করেছে। যদিও এখনও “ওরাকল টিটিটি” (আদর্শ বেসলাইন) এর নিচে, এটি উল্লেখযোগ্য অগ্রগতি নির্দেশ করে।

জন্য জ্ঞান একীকরণSQuAD নিবন্ধগুলি থেকে নতুন তথ্যগুলিকে অন্তর্ভুক্ত করার জন্য একটি বড় Qwen2.5-7B মডেল ব্যবহার করে, SEAL ধারাবাহিকভাবে বেসলাইন পদ্ধতিগুলিকে ছাড়িয়ে যেতে সক্ষম হয়েছিল৷ বেস Qwen-2.5-7B মডেল থেকে কৃত্রিমভাবে উত্পন্ন ডেটা সহ প্রশিক্ষণ ইতিমধ্যেই উল্লেখযোগ্য উন্নতি দেখায়, এবং পরবর্তী শক্তিবৃদ্ধি শেখার ফলে কর্মক্ষমতা আরও বৃদ্ধি পায়। বাহ্যিক RL পুনরাবৃত্তির তুলনায় নির্ভুলতাও দ্রুত উন্নতি দেখায়, প্রায়শই GPT-4.1 জেনারেটেড ডেটা ব্যবহার করে মাত্র দুটি পুনরাবৃত্তিতে সেটিংসকে ছাড়িয়ে যায়।

নিবন্ধের গুণগত উদাহরণগুলি ব্যাখ্যা করে যে কীভাবে শক্তিবৃদ্ধি শিক্ষা আরও বিস্তারিত স্ব-সম্পাদনা তৈরির দিকে নিয়ে যায়, যার ফলে কর্মক্ষমতা উন্নত হয়।

যদিও প্রতিশ্রুতিশীল, গবেষকরা SEAL ফ্রেমওয়ার্কের কিছু সীমাবদ্ধতাও স্বীকার করেন, যার মধ্যে বিপর্যয়মূলক ভুলে যাওয়া, কম্পিউটেশনাল ওভারহেড এবং প্রসঙ্গ-নির্ভর মূল্যায়ন সম্পর্কিত দিকগুলি রয়েছে। মূল নিবন্ধে এগুলি বিস্তারিতভাবে আলোচনা করা হয়েছে।

মূল কাগজ: https://arxiv.org/pdf/2506.10943

প্রকল্পের ওয়েবসাইট: https://jyopari.github.io/posts/seal

গিথুব রেপো: https://github.com/Continuous-Intelligence/SEAL

The post এমআইটি গবেষকরা ‘সাইন’ উন্মোচন করেছেন: স্ব-উন্নতি কৃত্রিম বুদ্ধিমত্তার দিকে একটি নতুন পদক্ষেপ appeared first on Synced.



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *

Rutgers UMass Грег Скиано Rutgers против UMass Кей-Джей Дафф расписание матчей Rutgers по футболу Поп Уотсон футбол NCAA (FBS I) UMass Rutgers Уильям Уотсон III Rutgers UMass прогноз на матч UMass — Rutgers футбол NCAA счет матча Rutgers футбол UMass 2025 матчи студенческого футбола матч Rutgers футбол Illinois UAB против Illinois футбол UAB футбол Illini UAB Катин Хаузер Illinois против UAB Red Sox против Orioles Эдли Ратчман Orioles Baltimore Orioles Red Sox — Orioles Ник Согард மரியா பார்டிரோமோ ஃபாக்ஸ் நியூஸிலிருந்து மரியா பார்டிரோமோ விலகல் மரியா பார்டிரோமோவுக்கு என்ன ஆனது மரியா பார்டிரோமோ ஏன் ஃபாக்ஸை விட்டு வெளியேறினார் மரியா பார்டிரோமோவின் இன்றைய அறிவிப்பு பார்டிரோமோ மரியா பார்டிரோமோவின் மன்னிப்பு மரியா ஃபாக்ஸை விட்டு வெளியேறுகிறார் ஃபாக்ஸ் நியூஸிலிருந்து மரியா பார்டிரோமோ விலகல் மரியா ஃபாக்ஸ் நியூஸை விட்டு வெளியேறுகிறார் மரியா பார்டிரோமோ ஃபாக்ஸை விட்டு வெளியேறினாரா மரியா ஃபாக்ஸ் நியூஸ் மரியா பார்டிரோமோ ஏன் ஃபாக்ஸ் நியூஸை விட்டு வெளியேறினார் ஃபாக்ஸ் நியூஸிலிருந்து மரியா பார்டிரோமோ வெளியேற்றம் ஃபாக்ஸ் நியூஸை விட்டு யார் வெளியேறுகிறார்கள் மரியா பார்டிரோமோ ஃபாக்ஸ் பிசினஸை விட்டு வெளியேறுகிறார் மரியா பார்டிரோமோ ஏன் அவரது நிகழ்ச்சியில் இல்லை மரியா ஏன் ஃபாக்ஸ் நியூஸை விட்டு வெளியேறினார் மரியா ஃபாக்ஸை விட்டு வெளியேறுகிறார் ஃபாக்ஸ் நியூஸ் மரியா பார்டிரோமோ கொலராடோ vs ஜார்ஜியா டெக் ஜார்ஜியா டெக் vs கொலராடோ ஜிஏ டெக் கால்பந்து ஜூலியன் லூயிஸ் ஜார்ஜியா டெக் ஜிஏ டெக் vs கொலராடோ ஜிடி கால்பந்து ஜிடி vs கொலராடோ சியு கால்பந்து கல்லூரி கால்பந்து புள்ளிகள் பூ கார்ட்டர் கொலராடோ பஃபலோஸ் கால்பந்து டீயோன் சாண்டர்ஸ் கொலராடோ ஜார்ஜியா டெக் கொலராடோ கால்பந்து புள்ளி ஜார்ஜியா டெக் புள்ளி CU பஃப்ஸ் கால்பந்து