বেশিরভাগ ডিকোড-শুধু এলএলএম-এ, টোকেন টি-এর শেষ স্তরে গণনা করা কিছুই টোকেন t+1-এর প্রথম স্তরকে ফিড করে না; অবস্থানগুলি শুধুমাত্র ক্যাশে করা কী এবং মানগুলির প্রতি মনোযোগ দিয়ে যোগাযোগ করে। প্রিন্সটনের গবেষক (জিফান ঝাং), রিকারেন্ট লুপড ট্রান্সফরমার (আরএলটি) এর একটি প্রযুক্তিগত প্রতিবেদন এই লুপটি বন্ধ করার প্রস্তাব করেছে। ডিকোডারের চূড়ান্ত লুকানো অবস্থা এবং এর লেয়ার স্লাইডিং উইন্ডো (SWA) মনোযোগ ক্যাশে সীমানা রিসেট ছাড়াই, প্রম্পট এবং প্রতিক্রিয়া উভয় জুড়েই পরবর্তী টোকেনে বহন করা হয়। প্রস্তাবিত গবেষণা একটি নকশা স্পেসিফিকেশন. এটি RL এর আর্কিটেকচার, এক্সিকিউশন সময়সূচী এবং রিপ্লে চুক্তিকে সংজ্ঞায়িত করে এবং এটি বিশেষভাবে পরিমাপকৃত কার্যকারিতা, যুক্তির গুণমান বা স্কেল ফলাফলের প্রতিবেদন করে।
কিভাবে RLT নির্মিত হয়েছিল
পুনরাবৃত্ত লুপড ট্রান্সফরমার (RLT) একটি পুনরাবৃত্ত ডিকোডারের সাথে একটি কার্যকারণ এনকোডারকে একত্রিত করে। এনকোডার একটি কার্যকারণ মুখোশের অধীনে সমান্তরালভাবে টোকেনগুলি প্রক্রিয়া করে এবং উপস্থাপনা e_t তৈরি করে, যেখান থেকে একটি কী-মানের মেমরি M≤t প্রজেক্ট করা হয়; মেমরি পুল ডিকোডার স্তর (G = 1) জুড়ে ভাগ করা যেতে পারে বা নির্দিষ্ট স্তরগুলির জন্য সংরক্ষিত (G = L_D)।
ডিকোডার রিটার্ন ধরে রাখে। এর পূর্ণ অবস্থা Hনবম = (এসনবমতৃতীয়নবমd), যেখানে এসনবম চূড়ান্ত ডিকোডার আউটপুট এবং সিনবমd প্রতিটি ডিকোডার স্তরে সংরক্ষিত SWA কী এবং মান ধরে রাখে। প্রতিটি টোকেনের জন্য, মার্জ ধাপ ই থেকে বন্ধ করা হয়েছেনবম পূর্ববর্তী আউটপুট s সহ{t-1}তাই প্রতিটি ডিকোডার ব্লক ডিকোডার অ্যাক্টিভেশন, এনকোডার মেমরিতে ক্রস-অ্যাটেনশন এবং এফএফএন-এ একটি কার্যকারণ SWA কার্যকর করে। W উইন্ডোতে বর্তমান টোকেন রয়েছে, তাই প্রতি স্তরে সর্বাধিক W – 1টি ঐতিহাসিক মান সংরক্ষণ করা হয়। নিম্নলিখিত টোকেন বিতরণ s থেকে বলা হয়নবমএবং একটি শেখা স্টার্ট স্টেট * এবং একটি খালি ক্যাশে সহ BOS এর আগে একবার শুরু হয়।
উল্লেখিত কনফিগারেশনটি 48টি এনকোডার এবং 48টি ডিকোডার স্তর ব্যবহার করে যার সাথে সংশ্লিষ্ট মনোযোগ ওজন এবং FFN ওজন তাদের মধ্যে ভাগ করা হয়েছে। তাই প্রতিটি টোকেন 96টি লজিক ব্লক চালায়, যদিও ডিকোডার ব্লকগুলি ক্রস-অ্যাটেনশন যোগ করে, তাই প্রতি ব্লকে FLOP সমান নয়। Zhang এই পরামিতি পুনরায় ব্যবহার কল, অধিবেশন অনুলিপি না.
3 নকশা নীতি
- সীমাহীন অস্থায়ী গভীরতার সাথে অন্তর্নিহিত চিন্তাভাবনা: টি প্রসেসড টোকেন পরে, s থেকে স্টেট পাথ0 t·L অতিক্রম করেd ডিকোডার ব্লক, বা রেফারেন্স কনফিগারেশনে 48t। টোকেন প্রতি কাজ স্থির থাকে যখন পথের কাঠামোগত গভীরতা অনুক্রমের সাথে বৃদ্ধি পায়। গবেষণা প্রতিবেদনে সতর্ক করা হয়েছে যে গেট এবং সংকোচন দীর্ঘ লেনকে দমন করতে পারে; কাঠামোগত গভীরতা যুক্তির গ্যারান্টি নয়।
- মডেল-হার্ডওয়্যারের সহ-ডিজাইন: পরিচিত টোকেনগুলির জন্য এনকোডার বৈশিষ্ট্য এবং মেমরি প্রজেকশন সমান্তরাল টোকেন কার্নেল ব্যবহার করে। ডিকোডার পাসগুলি একটি অনুক্রমের মধ্যে অনুক্রমিক থাকে, তবে স্বাধীন ক্রম থেকে প্রস্তুত আপডেটগুলি একটি একক ব্যাচ কোর ভাগ করতে পারে। রিপোর্টে স্পষ্টভাবে বলা হয়েছে যে অরৈখিক ডিকোডারের জন্য কোন সঠিক সমান্তরাল স্ক্যান নেই, প্রিফিল স্পিড কমানোর দাবি নেই এবং একটি সমান্তরাল SWA ডিকোডার স্ট্যান্ডার্ড পাস পুনরাবৃত্তির সমতুল্য নয়। ব্যাচিং, কোর ফিউশন, এবং চেকপয়েন্টিং বাস্তবায়ন লক্ষ্য হিসাবে তালিকাভুক্ত করা হয়েছে, সম্পূর্ণ কার্নেল নয়।
- একটি মডেল-আরএল অ্যালগরিদমের সহ-ডিজাইন: প্রিট্রেইনিং, SFT, স্যাম্পলিং, এবং RL রিপ্লে এক স্টেট ট্রানজিশন শেয়ার করে। RL এর জন্য, নমুনাটি তাপমাত্রা এবং কাটঅফ সহ তার প্রকৃত নমুনা বিতরণের অধীনে প্রতিটি অপারেশনের আচরণের লগ সম্ভাব্যতা রেকর্ড করে। প্রশিক্ষক প্রতিটি অ্যাকশন স্কোর করার আগে বর্তমান পরামিতিগুলির অধীনে প্রারম্ভিক ক্রম থেকে এনকোড করা মেমরি, পুনরাবৃত্ত আউটপুট এবং প্রতিটি SWA ক্যাশে পুনর্নির্মাণ করেন; পুরানো লঞ্চ মোড পুনরায় ব্যবহার করা হয় না. প্রস্তাব 3.1 অর্থপ্রদানকে আনুষ্ঠানিক করে: তাৎক্ষণিক প্রতিক্রিয়া বিভক্ত স্থানান্তর করা একটি নির্দিষ্ট টোকেন ইতিহাসের জন্য শর্তসাপেক্ষ বন্টন অপরিবর্তিত রাখে।
প্রশিক্ষণ এবং জমা
প্রিট্রেইনিং হল পরবর্তী টোকেনের ভবিষ্যদ্বাণী করা হচ্ছে একটি পূর্ণ ক্রমানুসারে যা সময়ের সাথে সাথে সম্পূর্ণ ব্যাক প্রচারের সাথে। এসএফটি সাহায্যকারী লক্ষ্যগুলির জন্য ক্ষতিকে মুখোশ করে তবে কখনই স্টেট আপডেটগুলিকে মুখোশ করে না, তাই সাহায্যকারীর ক্ষতিগুলি ব্যবহারকারী এবং টুল টোকেনের মাধ্যমে প্রচার করা হয়। পরিশিষ্ট বি দেখায় কেন আংশিক ডিকপলিং বিপজ্জনক: স্টেট-টু-স্টেট জ্যাকোবিয়ান কেভি ডিকোডারের মাধ্যমে ক্রস টার্ম আছে, তাই ডিকপলিং শুধুমাত্র sনবম ক্যাশে মাধ্যমে ট্রানজিট রুট ছেড়ে; যেকোন ছেঁটে যাওয়া BPTT স্কিম অবশ্যই প্রতিটি ছেঁটে যাওয়া টেনসরের নাম দিতে হবে।
মাল্টি-হপ ডেলিভারির জন্য, একটি সঠিক প্রিফিক্স স্ন্যাপশটে ক্যাশে এবং এনকোড করা মেমরি, সম্পূর্ণ ডিকোডার স্টেট, অবস্থান মেটাডেটা, উইন্ডো কনভেনশন এবং মডেল সংস্করণ অন্তর্ভুক্ত থাকে। একটি নির্দিষ্ট ওজনের স্ন্যাপশট পুনঃব্যবহারযোগ্য কারণ রাষ্ট্র পরিবেশন বিভাজন থেকে স্বাধীন; ওজন আপডেট পুরানো অবস্থা বাতিল করে, এবং একটি উপসর্গ সম্পাদনা পূর্ববর্তী চেকপয়েন্ট থেকে একটি পুনঃগণনা করতে বাধ্য করে। RL মাল্টিকাস্টে বাহ্যিক টোকেনগুলি রাজ্যকে আপডেট করে কিন্তু গুরুত্বের কারণগুলি পায় না।
এটি পূর্ববর্তী কাজের সাথে কীভাবে সম্পর্কিত?
এনকোডার থেকে প্রাপ্ত মেমরি YOCO অনুসরণ করে, যা ক্রস-ডিকোডারের জন্য একবার KV সঞ্চয় করে এবং ডিপসিক-V4.1-ফ্ল্যাশ, যা সসীম এনকোডার স্টেট থেকে ডিকোডার গ্লোবাল কেভি প্রজেক্ট করে; RLT মেমরি সংরক্ষণ করে কিন্তু একটি সম্পূর্ণ ডিকোডার এড়িয়ে যাওয়া দূর করে। অস্থায়ী প্রতিক্রিয়া ট্রান্সফরমার এবং পুনরাবৃত্ত ট্রান্সফরমার উপর ভিত্তি করে; পরিবর্তে, RLT পূর্ববর্তী চূড়ান্ত ডিকোডার আউটপুটকে পরবর্তী ডিকোডার ইনপুটে ফিড করে এবং একই সাথে নির্দেশের পুনরাবৃত্তি সক্রিয় করে। গভীর পুনঃব্যবহার সার্বজনীন রোবোটিক্স এবং গভীরতার পুনরাবৃত্তিমূলক অন্তর্নিহিত যুক্তির সাথে সংযোগ করে; রিপ্লে আর্গুমেন্ট ঝাং এর আগের মূল অসঙ্গতি মন্তব্যের উপর প্রসারিত হয়।