লেখক(রা): রোহন মিস্ত্রী
মূলত টুওয়ার্ডস এআই-তে পোস্ট করা হয়েছে।
আপনার বিচারক ক্যালিব্রেট করুন. তার পক্ষপাত খুঁজে বের করুন। আপনার গ্রেড বিশ্বাস.
আপনার এলএলএম রেফারি আপনার সাথে মিথ্যা কথা বলতে পারেন।

ক্যালিব্রেটেড LLM অনুমানকারীদের সমস্যা উপস্থাপন করার পরে, নিবন্ধটি ব্যাখ্যা করে যে এলএলএম-এ-জজ আসলে কী (একটি মডেল যা মানদণ্ড/নিয়ম ব্যবহার করে অন্য মডেলের আউটপুট স্কোর করে), কেন দলগুলি মানব পর্যালোচনা বা স্ট্রিং/কোড চেকের পরিবর্তে এটি ব্যবহার করে, এবং তিনটি সাধারণ বিচার মোড – একক আউটপুট স্কোরিং, জুটিবদ্ধ পদ্ধতিতে, এবং সাধারণ পদ্ধতির উপর ভিত্তি করে সেরা স্কোর ব্যবহার করে। তিনি প্রমাণ পর্যালোচনা করেন যে বিচারকরা শুধুমাত্র মানুষের পছন্দের সাথে সারিবদ্ধ করতে পারেন যখন প্রাসঙ্গিক কাজটি সঠিকভাবে ক্যালিব্রেট করা হয় এবং তারপরে চারপাশে ডিজাইন করার জন্য মূল পক্ষপাতের বিবরণ দেন (যেমন অবস্থানের পক্ষপাতিত্ব এবং স্ব-অভিরুচি)। মূল অ্যাপ্লিকেশন বিভাগটি একটি ব্যবহারিক নয়-পদক্ষেপ প্রক্রিয়া প্রদান করে: বাস্তব ব্যর্থতার পরিস্থিতি থেকে শুরু করুন, মানদণ্ড সীমাবদ্ধ করুন, বাইনারি সিদ্ধান্ত ব্যবহার করুন, রায়ের আগে যুক্তি প্রয়োগ করুন, বেশ কয়েকটি-শট অ্যাঙ্কর যোগ করুন, সাবডিসিশনে বিষয়গত রায়গুলিকে পচন, পিন কনফিগারেশন, মানব লেবেলের বিরুদ্ধে ক্যালিব্রেট করুন যখন উপযুক্ত চুক্তির মেট্রিক্স, উচ্চ চুক্তিতে প্রবেশ করুন। এটি পর্যবেক্ষণ/বৈধতা অনুশীলন (“বিচারকের রায়”) দিয়ে সমাপ্ত হয়, যেখানে বিচারকদের CI/রিগ্রেশন গেটে বসাতে হবে, প্রি-রিলিজ তুলনা এবং প্রোডাকশন মনিটরিং, কখন কোন বিচারক ব্যবহার করবেন না (যখন নির্ধারক পরীক্ষা, সস্তা গ্রাউন্ড ট্রুথ বা বিশেষজ্ঞ জ্ঞান প্রযোজ্য), এবং এই অনুমান যে LLM বিচারক একটি ছোট সংস্করণ, এমএল ফিক্স করার জন্য একটি ছোট সংস্করণ তৈরি করা প্রয়োজন।
মিডিয়াম বিনামূল্যে সম্পূর্ণ ব্লগ পড়ুন.
টুওয়ার্ডস এআই এর মাধ্যমে পোস্ট করা হয়েছে