ওপেন-এন্ডেড প্রশ্নের উত্তর দেওয়ার জন্য কার্যকর পুরষ্কার সংকেত ডিজাইন করা চ্যালেঞ্জিং কারণ উচ্চ-মানের প্রতিক্রিয়াগুলিকে একই সাথে উত্তর মানের একাধিক দিক পূরণ করতে হবে যা একটি সামগ্রিক স্কেলার উদ্দেশ্যের সাথে ক্যাপচার করা কঠিন। আমরা একটি রুব্রিক-ভিত্তিক পুরষ্কার কাঠামো উপস্থাপন করি যা পুনরুদ্ধার করা প্রমাণের উপর ভিত্তি করে কোয়েরি-নির্দিষ্ট রুব্রিক তৈরি করে এবং একাধিক মানের মাত্রায় বিভক্ত করে, এবং প্রশিক্ষণ-পরবর্তী সময়ে সূক্ষ্ম-দানাদার তদারকি প্রদান করে। তিনটি মূল্যায়ন অক্ষ (কম্পোজিশন, গ্রাউন্ডিং এবং নির্দেশনা অনুসরণ) জুড়ে গড়ে, আমাদের পদ্ধতি নির্দেশ-ভিত্তিক বেসলাইনে 6.5% এবং ফ্ল্যাট রুব্রিক সংস্করণগুলির উপরে 4% দ্বারা উন্নতি করেছে, সমস্ত মূল্যায়ন ডেটাসেট জুড়ে ধারাবাহিক লাভ সহ। পুনরুদ্ধার করা প্রমাণের উপর কন্ডিশনিং রুব্রিকগুলি বাস্তবিক সমর্থনকে উন্নত করে, যখন রুব্রিকগুলিকে গুণমানের নির্দিষ্ট মাত্রায় ভেঙে ফেলার ফলে কোয়েরির প্রয়োজনীয়তাগুলির সাথে সমন্বয়, সংগঠন এবং সম্মতি আরও উন্নত হয়। আমাদের ফলাফলগুলি দেখায় যে প্রতিষ্ঠিত, বহুমাত্রিক রুব্রিকগুলি ওপেন-এন্ডেড ডোমেন প্রশ্নের জটিল উত্তর দেওয়ার জন্য আরও কার্যকর পুরষ্কার পর্যবেক্ষণ প্রদান করে।