আমার গবেষণা শেয়ার করুন1.5 মিলিয়নেরও বেশি বিশ্বব্যাপী AI উত্সাহীদের সাথে তাদের নিজস্ব গবেষণার অগ্রগতি শেয়ার করার জন্য গবেষকদেরকে স্বাগত জানায় সিঙ্কডের কলাম। প্রযুক্তিগত উন্নতির বাইরে,আমার গবেষণা শেয়ার করুনএছাড়াও গবেষণা এবং উত্তেজনাপূর্ণ গবেষণা ধারনা পিছনে আকর্ষণীয় গল্প আহ্বান. আমাদের সাথে যোগাযোগ করুন: chain.zhang@jiqizhixin.com
লেখকদের সাথে দেখা করুন
প্রতিষ্ঠান: পেন স্টেট ইউনিভার্সিটি, ডিউক ইউনিভার্সিটি, গুগল ডিপমাইন্ড, ইউনিভার্সিটি অফ ওয়াশিংটন, মেটা, নানিয়াং টেকনোলজিক্যাল ইউনিভার্সিটি এবং ওরেগন স্টেট ইউনিভার্সিটি। প্রথম লেখকরা হলেন শাওকুন ঝাং পেন স্টেট ইউনিভার্সিটি থেকে এবং মিং ইয়িন ডিউক বিশ্ববিদ্যালয় থেকে।
সাম্প্রতিক বছরগুলিতে, এলএলএম মাল্টি-এজেন্ট সিস্টেমগুলি জটিল সমস্যা সমাধানের জন্য তাদের সহযোগিতামূলক পদ্ধতির জন্য ব্যাপক মনোযোগ পেয়েছে। যাইহোক, এটি একটি সাধারণ দৃশ্য যে এই সিস্টেমগুলি প্রচুর কার্যকলাপ সত্ত্বেও কাজটি ব্যর্থ করে। এটি ডেভেলপারদের একটি সমালোচনামূলক প্রশ্ন ছেড়ে দেয়: কোন এজেন্ট, কোন পর্যায়ে, ব্যর্থতার জন্য দায়ী ছিল? মূল কারণ খুঁজে বের করার জন্য বিশাল মিথস্ক্রিয়া লগগুলির মধ্যে দিয়ে sifting একটি খড়ের গাদা মধ্যে একটি সুই খুঁজে পাওয়ার মত মনে হয় – একটি সময় সাপেক্ষ এবং প্রচেষ্টা-নিবিড় প্রচেষ্টা।
এটি বিকাশকারীদের জন্য একটি পরিচিত হতাশা। ক্রমবর্ধমান জটিল মাল্টি-এজেন্ট সিস্টেমে, ব্যর্থতাগুলি কেবল সাধারণ নয়, এজেন্ট সহযোগিতার স্বায়ত্তশাসিত প্রকৃতি এবং দীর্ঘ তথ্য চেইনের কারণে নির্ণয় করা অবিশ্বাস্যভাবে কঠিন। ব্যর্থতার উৎস দ্রুত সনাক্ত করার উপায় ছাড়াই, সিস্টেম পুনরাবৃত্তি এবং অপ্টিমাইজেশান স্টল।
এই চ্যালেঞ্জ মোকাবেলা, থেকে গবেষকরা পেন স্টেট ইউনিভার্সিটি এবং ডিউক বিশ্ববিদ্যালয়সহ প্রতিষ্ঠানের সহযোগিতায় গুগল ডিপমাইন্ডএর উদ্ভাবনী গবেষণা সমস্যা প্রবর্তন করুন “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন।” তারা এই কাজের জন্য প্রথম টেস্ট ডেটাসেট তৈরি করেছে, কে এবং কখনএবং বেশ কয়েকটি স্বয়ংক্রিয় অ্যাট্রিবিউশন পদ্ধতি বিকাশ ও মূল্যায়ন করেছে। এই কাজটি শুধুমাত্র কাজের জটিলতাকেই হাইলাইট করে না বরং এলএলএম মাল্টি-এজেন্ট সিস্টেমের নির্ভরযোগ্যতার উন্নতির দিকে একটি নতুন পথও প্রশস্ত করে।
নথি প্রায় গৃহীত হয় শীর্ষ স্তরের মেশিন লার্নিং সম্মেলনে স্পটলাইট উপস্থাপনা, ICML 2025এবং কোড এবং ডেটাসেট এখন সম্পূর্ণরূপে ওপেন সোর্স।
কাগজ: https://arxiv.org/pdf/2505.00212
কোড: https://github.com/mingyin1/Agents_Failure_Attribution
ডেটাসেট: https://huggingface.co/datasets/Kevin355/Who_and_When
গবেষণা পটভূমি এবং চ্যালেঞ্জ
এলএলএম দ্বারা চালিত মাল্টি-এজেন্ট সিস্টেমগুলি অনেক ক্ষেত্রে প্রচুর সম্ভাবনা দেখিয়েছে। যাইহোক, এই সিস্টেমগুলি ভঙ্গুর; একক এজেন্টের ত্রুটি, এজেন্টদের মধ্যে ভুল বোঝাবুঝি, বা তথ্য প্রেরণে ভুল পুরো মিশনের ব্যর্থতার কারণ হতে পারে।
বর্তমানে, যখন একটি সিস্টেম ব্যর্থ হয়, তখন বিকাশকারীদের প্রায়ই ম্যানুয়াল এবং অকার্যকর ডিবাগিং পদ্ধতি রেখে দেওয়া হয়:
জার্নালে ম্যানুয়াল প্রত্নতত্ত্ব : ডেভেলপারদের অবশ্যই সমস্যার উৎস খুঁজতে দীর্ঘ মিথস্ক্রিয়া লগগুলিকে ম্যানুয়ালি পর্যালোচনা করতে হবে৷
দক্ষতার উপর নির্ভরতা : ডিবাগিং প্রক্রিয়াটি বিকাশকারীর সিস্টেম এবং হাতে থাকা কাজ সম্পর্কে গভীর বোঝার উপর নির্ভর করে।
ডিবাগিংয়ের জন্য এই “খড়ের গাদায় সুই” পদ্ধতিটি কেবল অদক্ষ নয় বরং দ্রুত সিস্টেমের পুনরাবৃত্তি এবং সিস্টেমের নির্ভরযোগ্যতার উন্নতিতে ব্যাপকভাবে বাধা দেয়। ব্যর্থতার কারণ খুঁজে বের করার জন্য এবং “অ্যাসেসমেন্ট ফলাফল” এবং “সিস্টেম উন্নতি” এর মধ্যে ব্যবধান কার্যকরভাবে পূরণ করার জন্য একটি স্বয়ংক্রিয় এবং পদ্ধতিগত পদ্ধতির জরুরী প্রয়োজন।
মূল অবদান
এই নিবন্ধটি উপরোক্ত চ্যালেঞ্জ মোকাবেলায় বেশ কিছু যুগান্তকারী অবদান রাখে:
1. একটি নতুন সমস্যা সংজ্ঞায়িত করুন: একটি নির্দিষ্ট গবেষণা কাজ হিসাবে “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন” নিয়ে আসা কাগজটিই প্রথম। এই টাস্ক চিহ্নিত করে সংজ্ঞায়িত করা হয় ব্যর্থতার জন্য দায়ী ফ্যাক্টর এবং আপনি গুরুত্বপূর্ণ ত্রুটি পদক্ষেপ যা মিশনের ব্যর্থতার দিকে পরিচালিত করে।
2. প্রথম বেঞ্চমার্ক ডেটাসেট তৈরি করা: কে এবং কখন : এই ডেটাসেটে 127টি এলএলএম মাল্টি-এজেন্ট সিস্টেম থেকে সংগৃহীত বিভিন্ন ধরনের ব্যর্থতা লগ অন্তর্ভুক্ত রয়েছে, যা বাস্তবতা এবং বৈচিত্র্য নিশ্চিত করতে বিশেষজ্ঞদের দ্বারা হয় অ্যালগরিদমিকভাবে তৈরি বা হাতে তৈরি করা হয়েছে। প্রতিটি ব্যর্থতার লগের সাথে সূক্ষ্ম মানুষের মন্তব্য থাকে:
WHO: ব্যর্থতার জন্য দায়ী এজেন্ট।
যখন: নির্দিষ্ট মিথস্ক্রিয়া পদক্ষেপ যেখানে গুরুতর ত্রুটি ঘটেছে।
কেন: ব্যর্থতার কারণ সম্পর্কে স্বাভাবিক ভাষায় ব্যাখ্যা।
3. প্রাথমিক “স্বয়ংক্রিয় অ্যাট্রিবিউশন” পদ্ধতিগুলি পরীক্ষা করা: কে এবং কখন ডেটা সেট ব্যবহার করে, নিবন্ধটি স্বয়ংক্রিয় ব্যর্থতার বৈশিষ্ট্যের জন্য তিনটি ভিন্ন পদ্ধতি ডিজাইন এবং মূল্যায়ন করে:
– একযোগে: এই পদ্ধতিটি ব্যবহারকারীর ক্যোয়ারী এবং সম্পূর্ণ ব্যর্থতার লগ সহ LLM প্রদান করে এবং একটি পাসে দায়ী এজেন্ট এবং গুরুতর ত্রুটি পদক্ষেপ সনাক্ত করতে বলে। যদিও এটি লাভজনক, এটি দীর্ঘ প্রসঙ্গে সঠিক ত্রুটিগুলি খুঁজে পেতে সংগ্রাম করতে পারে।
– ধাপে ধাপে: এই পদ্ধতিটি ম্যানুয়াল ডিবাগিংকে অনুকরণ করে LLM দ্বারা পর্যায়ক্রমে ইন্টারঅ্যাকশন লগ পরীক্ষা করে, যতক্ষণ না ত্রুটি পাওয়া যায় প্রতিটি ধাপে বিচার করে। এটি ত্রুটি পর্যায় সনাক্তকরণের ক্ষেত্রে আরও সঠিক তবে উচ্চতর খরচ এবং ত্রুটিগুলি জমা করার ঝুঁকি জড়িত।
– বাইনারি অনুসন্ধান: প্রথম দুটি পদ্ধতির মধ্যে একটি সমঝোতা, এই কৌশলটি বারবার লগকে অর্ধেক ভাগ করে দেয়, কোন সেগমেন্টে ত্রুটি রয়েছে তা নির্ধারণ করতে LLM ব্যবহার করে। তারপরে এটি পুনরাবৃত্তভাবে চিহ্নিত সেগমেন্ট অনুসন্ধান করে, খরচ এবং কর্মক্ষমতার মধ্যে ভারসাম্য অফার করে।
পরীক্ষামূলক ফলাফল এবং মূল ফলাফল
পরীক্ষাগুলি দুটি সেটিংসে পরিচালিত হয়েছিল: একটি যেখানে এলএলএম সমস্যাটির প্রাথমিক উত্তর জানে যা মাল্টি-এজেন্ট সিস্টেম সমাধান করার চেষ্টা করছে (স্থল সত্যের সাথে) এবং একটি যেখানে নেই (স্থল সত্য ছাড়া) ব্যবহৃত প্রধান মডেলটি ছিল GPT-4o, যদিও অন্যান্য মডেলগুলিও পরীক্ষা করা হয়েছিল। কে এবং কখন কিছু গুরুত্বপূর্ণ অন্তর্দৃষ্টি প্রদান করে তার ডেটা সেটে এই পদ্ধতিগুলির পদ্ধতিগত মূল্যায়ন:
– একটি দীর্ঘ পথ যেতে: বর্তমান পদ্ধতি নিখুঁত থেকে অনেক দূরে. এমনকি একক সেরা পারফরম্যান্স পদ্ধতিও প্রায় নির্ভুলতা অর্জন করেছে 53.5% দায়ী এজেন্ট এবং সহজ সনাক্তকরণ 14.2% সঠিক ত্রুটি পদক্ষেপ সনাক্তকরণে. কিছু পদ্ধতি এলোমেলো অনুমান করার চেয়েও ভাল কাজ করেছে, টাস্কের অসুবিধার উপর জোর দিয়েছে।
– কোন “সব এক” সমাধান নেই।: বিভিন্ন পদ্ধতি সমস্যার বিভিন্ন দিক থেকে এক্সেল. দ সব একযোগে পদ্ধতিটি “কে” শনাক্ত করার ক্ষেত্রে ভাল ধাপে ধাপে পদ্ধতিটি “কখন” নির্ধারণে আরও কার্যকর। দ বাইনারি অনুসন্ধান পদ্ধতি মধ্যম কর্মক্ষমতা প্রদান করে.
– হাইব্রিড পন্থা প্রতিশ্রুতিশীল কিন্তু উচ্চ খরচ: গবেষকরা দেখেছেন যে বিভিন্ন পদ্ধতি একত্রিত করা, যেমন একটি সম্ভাব্য এজেন্ট সনাক্ত করার জন্য একটি সমস্ত-এ-একবার পদ্ধতি ব্যবহার করা এবং তারপরে ত্রুটি খুঁজে পেতে ধাপে ধাপে পদ্ধতি প্রয়োগ করা, সামগ্রিক কর্মক্ষমতা উন্নত করতে পারে। যাইহোক, এটি গণনামূলক খরচে উল্লেখযোগ্য বৃদ্ধির সাথে আসে।
– বর্তমান মডেলের সংগ্রাম: আশ্চর্যজনকভাবে, এমনকি সবচেয়ে উন্নত লজিক মডেল, যেমন OpenAI o1 এবং DeepSeek R1, এই কাজটিকে চ্যালেঞ্জিং বলে মনে করে। এটি স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশনের অন্তর্নিহিত অসুবিধাকে হাইলাইট করে, যা আরও প্রচলিত কাজের জন্য প্রয়োজনীয়তার চেয়ে উচ্চ স্তরের চিন্তার প্রয়োজন।
– সুস্পষ্ট যুক্তির গুরুত্ব: একযোগে এবং ধাপে ধাপে পদ্ধতি ব্যবহার করে LLM-কে তাদের যুক্তি ব্যাখ্যা করার জন্য সুস্পষ্ট নির্দেশাবলী প্রদান করা কর্মক্ষমতা উন্নত করতে দেখানো হয়েছে। 
– প্রসঙ্গের দৈর্ঘ্য একটি সীমাবদ্ধ ফ্যাক্টর: সমীক্ষায় আরও দেখা গেছে যে ব্যর্থতার লগগুলির প্রসঙ্গ দৈর্ঘ্য বৃদ্ধির সাথে সাথে সমস্ত রেফারেন্স পদ্ধতির কার্যকারিতা হ্রাস পেতে থাকে, ত্রুটি পর্যায়ে সনাক্তকরণের নির্ভুলতার উপর আরও স্পষ্ট প্রভাব সহ।
– ভবিষ্যত আউটলুক: আরো নির্ভরযোগ্য মাল্টি-এজেন্ট সিস্টেমের জন্য পথ প্রশস্ত করা
“স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন” মাল্টি-এজেন্ট সিস্টেমের বিকাশের জীবন চক্রের একটি অপরিহার্য উপাদান। এটি একটি বিভ্রান্তিকর রহস্য থেকে “কী ভুল হয়েছে এবং কে দায়ী” সনাক্তকরণের চ্যালেঞ্জকে একটি পরিমাপযোগ্য এবং বিশ্লেষণযোগ্য সমস্যায় রূপান্তরিত করার সম্ভাবনা রয়েছে। মূল্যায়ন এবং উন্নতির মধ্যে একটি সেতু তৈরি করে, আমরা শেষ পর্যন্ত বহু-এজেন্ট সিস্টেম তৈরি করতে পারি যা আরও নির্ভরযোগ্য, বুদ্ধিমান এবং নির্ভরযোগ্য।
কোন এজেন্ট মিশন ব্যর্থতার কারণ এবং কখন? পোস্ট পিএসইউ এবং ডিউক গবেষকরা এলএলএম মাল্টি-এজেন্ট সিস্টেমের স্বয়ংক্রিয় ব্যর্থতার অ্যাট্রিবিউশন তদন্ত করেছেন প্রথমবার সিঙ্ক করা হয়েছে।
Source link