ইলিয়াস এট আল এর ধারা 3.2। (2019) দেখায় যে শুধুমাত্র প্রতিপক্ষের ত্রুটির উপর একটি মডেলকে প্রশিক্ষণ দিলে তা মূল পরীক্ষার সেটে অ-তুচ্ছ অন্তর্ভুক্তির দিকে নিয়ে যায়। আমরা দেখাই যে এই পরীক্ষাগুলি ত্রুটি থেকে শেখার একটি নির্দিষ্ট ক্ষেত্রে। আমরা একটি কাউন্টারইন্টুইটিভ ফলাফল দিয়ে শুরু করি – আমরা একটি সম্পূর্ণ ভুল লেবেলযুক্ত প্রশিক্ষণ সেট নিই (ইনপুটগুলি পরিবর্তন না করে) এবং এটিকে একটি মডেল প্রশিক্ষণের জন্য ব্যবহার করি যা মূল পরীক্ষার সেটটিকে সাধারণীকরণ করে। আমরা তখন দেখাই যে এই ফলাফল, এবং ইলিয়াস এট আল এর ফলাফল। (2019), মডেল পরিমার্জনের একটি বিশেষ ক্ষেত্রে। বিশেষ করে, যেহেতু একটি প্রশিক্ষিত মডেল ব্যবহার করে ভুল লেবেল তৈরি করা হয়, তাই প্রশিক্ষিত মডেলের তথ্য ডেটাসেটে “লিক” হয়ে যায়। চলুন নিচের প্রশ্নটি দিয়ে শুরু করা যাক: আমরা যদি ট্রেনিং সেটে ছবি তুলি (কোন প্রতিপক্ষের হস্তক্ষেপ ছাড়াই) এবং ভুল লেবেল করি? যেহেতু ইনপুটগুলি অপরিবর্তনীয় এবং ভুল লেবেলযুক্ত, অন্তর্জ্ঞান বলে যে এই ডেটা সেটে প্রশিক্ষিত একটি মডেল সঠিকভাবে লেবেলযুক্ত পরীক্ষার সেটে সাধারণীকরণ করা উচিত নয়। যাইহোক, আমরা দেখাই যে এই অন্তর্দৃষ্টি ব্যর্থ হয় – একটি মডেল টিন সাধারণীকরণ আমরা প্রথমে দুটি যুগের জন্য CIFAR-10 প্রশিক্ষণ সেটে ResNet-18 প্রশিক্ষণ দিই। মডেলটি 62.5% এর একটি প্রশিক্ষণ নির্ভুলতা এবং 63.1% এর একটি পরীক্ষা নির্ভুলতা পৌঁছেছে। তারপরে আমরা সমস্ত 50,000 প্রশিক্ষণ ডেটা পয়েন্টে মডেলটি চালাই এবং মডেলের ভবিষ্যদ্বাণী অনুসারে সেগুলিকে পুনরায় লেবেল করি। তারপর, আমরা ফিল্টার সমস্ত সঠিক ভবিষ্যদ্বাণী. আমাদের কাছে এখন 18,768 আকারের একটি ভুল লেবেলযুক্ত প্রশিক্ষণ সেট রয়েছে। আমরা নীচের চিত্রের বাম দিকে চারটি উদাহরণ দেখাই:

1
তারপরে আমরা এলোমেলোভাবে একটি নতুন ResNet-18 শুরু করি এবং এটিকে শুধুমাত্র ভুল শ্রেণিবদ্ধ ডেটাসেটে প্রশিক্ষণ দিই। আমরা 50টি যুগের জন্য প্রশিক্ষণ দিই এবং 49.7% এর নির্ভুলতায় পৌঁছাই মূল পরীক্ষার সেট। নতুন মডেলটি কখনও হস্তক্ষেপ ছাড়াই ভুল শ্রেণিবদ্ধ চিত্রগুলি দেখেছে, তবে এখনও অ-তুচ্ছভাবে সাধারণীকরণ করতে পারে।
এটি ভুল ভবিষ্যদ্বাণী ব্যবহার করে মডেল পরিমার্জন
কিভাবে এই মডেল এবং ইলিয়াস et al. (2019) সঠিকভাবে লেবেল করা ডেটা না দেখে সাধারণীকরণ করবেন? এখানে, আমরা দেখাই যে ভুল লেবেলগুলি একটি প্রশিক্ষিত মডেল ব্যবহার করে তৈরি করা হয়, সেই প্রশিক্ষিত মডেলের তথ্য লেবেলযুক্ত উদাহরণগুলিতে “ফাঁস” হয়৷ বিশেষ করে, এটি মডেল পরিমার্জনের একটি পরোক্ষ রূপ
আমরা প্রথমে একটি দ্বি-মাত্রিক সমস্যা ব্যবহার করে এই পাতনের ঘটনাটি চিত্রিত করব। এর পরে, আমরা নিউরাল নেটওয়ার্কগুলির জন্য পরিমার্জনার অন্যান্য অদ্ভুত রূপগুলি অন্বেষণ করি- আমরা জ্ঞান স্থানান্তর করি যদিও রেকর্ডিংগুলি একটি ভিন্ন কাজ থেকে হয়।
মডেল পাতনের 2D চিত্র
আমরা দ্বি-মাত্রিক বাইনারি শ্রেণীবিভাগ সমস্যা ব্যবহার করে প্রতিপক্ষের নমুনার একটি ডেটাসেট তৈরি করি। আমরা 32 এলোমেলো 2D ডেটা পয়েন্ট তৈরি করি এবং প্রতিটি পয়েন্টকে একটি এলোমেলো বাইনারি লেবেল বরাদ্দ করুন। তারপরে আমরা এই উদাহরণগুলিতে একটি ছোট ফিড-ফরোয়ার্ড নিউরাল নেটওয়ার্ককে প্রশিক্ষণ দিই, সঠিকভাবে 32/32টি উদাহরণ (নীচের চিত্রে প্যানেল (ক)) ভবিষ্যদ্বাণী করি।

2
এর পরে, আমরা একটি ব্যবহার করে মূল মডেলের জন্য প্রতিকূল উদাহরণ তৈরি করি ব্যাসার্ধ বল
. উপরের চিত্রের প্যানেলে (a) আমরা দেখাই – প্রতিটি প্রশিক্ষণ পয়েন্টের চারপাশে একটি বল। প্যানেলে (বি), আমরা প্রতিপক্ষের উদাহরণগুলি দেখাই যার কারণে মডেলটি তার ভবিষ্যদ্বাণী পরিবর্তন করে (সঠিক থেকে ভুল)। আমরা এই ডেটাসেটে একটি নতুন ফিড-ফরোয়ার্ড নিউরাল নেটওয়ার্ককে প্রশিক্ষণ দিই, ফলস্বরূপ প্যানেলে মডেল (c)।
যদিও এই নতুন মডেলটি কখনই সঠিকভাবে শ্রেণীবদ্ধ উদাহরণ দেখেনি, এটি মূল ডেটাসেটে অ-তুচ্ছভাবে পারফর্ম করতে সক্ষম, ভবিষ্যদ্বাণী করে সঠিকভাবে ইনপুটগুলির (চিত্রে প্যানেল (ডি))। নতুন মডেলের সিদ্ধান্তের সীমা মূল মডেলের সিদ্ধান্তের সীমার সাথে ঢিলেঢালাভাবে মেলে, অর্থাৎ, মূল মডেলটি তার পাল্টা উদাহরণগুলির প্রশিক্ষণের পরে কিছুটা পরিমার্জিত হয়। এই দ্বি-মাত্রিক সমস্যাটি কৌতূহলী ফলাফলের একটি দৃষ্টান্তমূলক সংস্করণ উপস্থাপন করে যা ভুল ভবিষ্যদ্বাণী ব্যবহার করে পরিমার্জন করা যেতে পারে।
পাতন অন্যান্য অদ্ভুত ফর্ম
আমাদের পরীক্ষাগুলি দেখায় যে আমরা ভুল উদাহরণ ব্যবহার করে মডেলগুলিকে পরিমার্জন করতে পারি। অন্য কোন অদ্ভুত উপায়ে আমরা আসল মডেল সম্পর্কে জানতে পারি? আমরা শুধুমাত্র ব্যবহার করতে পারেন সীমার বাইরে তথ্য?
আমরা 99.1% নির্ভুলতা অর্জন করে MNIST-এ একটি সাধারণ CNN মডেল প্রশিক্ষণ দিই। তারপরে আমরা এই মডেলটিকে FashionMNIST ট্রেনিং সেটে চালাই এবং এর argmax ভবিষ্যদ্বাণীগুলি সংরক্ষণ করি। ফলস্বরূপ ডেটা সেট মানুষের কাছে কোন অর্থবোধ করে না – “ড্রেস” “8” হিসাবে লেবেল করা হয়েছে।

3
তারপরে আমরা একটি নতুন CNN মডেল শুরু করি এবং এটিকে ভুল লেবেলযুক্ত FashionMNIST ডেটাতে প্রশিক্ষণ দিই। ফলস্বরূপ মডেলটি MNIST পরীক্ষা সেটে 91.04% এর নির্ভুলতায় পৌঁছেছে। অধিকন্তু, যদি আমরা MNIST-এর গড় এবং প্রকরণ পরিসংখ্যান ব্যবহার করে FashionMNIST চিত্রগুলিকে স্বাভাবিক করি, তাহলে মডেলটি MNIST পরীক্ষার সেটে 94.5% নির্ভুলতায় পৌঁছে। নতুন মডেলটি শুধুমাত্র ভুল ভবিষ্যদ্বাণীতে প্রশিক্ষিত হলেও আসলটির মতো কার্যকরীভাবে একটি মডেলকে পুনর্গঠন করার এটি আরেকটি কেস।
সারাংশ
এই ফলাফলগুলি দেখায় যে ভুল প্রতিপক্ষ উদাহরণ ব্যবহার করে একটি মডেলকে প্রশিক্ষণ দেওয়া হল ভবিষ্যদ্বাণী ত্রুটি থেকে শেখার একটি বিশেষ ক্ষেত্রে। অন্য কথায়, ইলিয়াস এট আল-এর অধ্যায় 3.2-তে প্রতিকূল উদাহরণ যোগ করা হয়েছে। (2019) শেখার সক্ষম করার জন্য প্রয়োজনীয় নয়।
প্রতিক্রিয়া সারাংশউল্লেখ্য যে যেহেতু আমাদের পরীক্ষাগুলি বিভিন্ন আর্কিটেকচার জুড়ে চলে, তাই ওজনের জায়গায় “পরিশোধন” ঘটে না। একমাত্র পাতন যা ঘটতে পারে তা হল একটি “স্পেস বৈশিষ্ট্যযুক্ত” পাতন, যা আসলে আমাদের অনুমান। বিশেষ করে, বিশ্ব 1-এ বৈশিষ্ট্য-স্পেস পাতন কাজ করবে না – যদি আমরা উত্পাদিত প্রতিকূল উদাহরণগুলি দরকারী বৈশিষ্ট্যগুলিকে কাজে লাগায় না, তাহলে আমাদের তাদের থেকে একটি দরকারী মডেল “পাতন” করা উচিত নয়। (আসলে, কেউ নিয়মিত মডেল প্রশিক্ষণকে “বৈশিষ্ট্য পরিমার্জন” হিসাবে ভাবতে পারে যারা ডেটাসেট লেবেল করেছে।) তদ্ব্যতীত, একটি মডেল পুনরুত্পাদন করার জন্য মডেলের জন্য যথেষ্ট সামঞ্জস্যপূর্ণ পয়েন্টের প্রয়োজন যে অনুমানটি “প্রীতমের একা ডেটাসেট” এবং অন্যদের দ্বারা অপ্রমাণিত বলে মনে হয় (যেমন।
প্রতিক্রিয়া: যেহেতু আমাদের পরীক্ষাগুলি বিভিন্ন আর্কিটেকচার জুড়ে চলে, তাই ওজনের জায়গায় “পাতন” ঘটতে পারে না। সুতরাং, আমরা যা বুঝি তা থেকে, এখানে প্রস্তাবিত “পরিমার্জন” অনুমানটি “বৈশিষ্ট্য পরিমার্জন” (অর্থাৎ মূলের মতো একই বৈশিষ্ট্যগুলি ব্যবহার করে এমন মডেলগুলি প্রাপ্ত করা) বোঝায়, যা আসলে আমাদের অনুমানও। উল্লেখযোগ্যভাবে, এই বৈশিষ্ট্যের পরিমার্জন করা সম্ভব হবে না যদি প্রতিদ্বন্দ্বী উদাহরণগুলি “রোলওভার” বৈশিষ্ট্যগুলির উপর নির্ভর না করে যেগুলি শ্রেণীবিভাগের জন্য ভাল (দেখুন বিশ্ব 1 এবং বিশ্ব 2) – সেক্ষেত্রে, পরিমার্জিত মডেল শুধুমাত্র এমন বৈশিষ্ট্যগুলি ব্যবহার করবে যা খারাপভাবে সাধারণীকরণ করে, এইভাবে খারাপভাবে সাধারণীকরণ করে৷
তদুপরি, এটি যুক্তি দেওয়া হয় যে উপস্থাপিত পরীক্ষাগুলিতে (ভুল লেবেলযুক্ত ডেটা থেকে শেখা), একই ধরণের পরিমার্জন ঘটে। উদাহরণস্বরূপ, একটি মোটামুটি সঠিক মডেল “ব্যাঙ” এর সাথে “সবুজ পটভূমি” যুক্ত করতে পারে এবং এইভাবে “সবুজ” চিত্রগুলিকে “ব্যাঙ” হিসাবে লেবেল করতে পারে (যেমন, টীকা চিত্রের ঘোড়া)। এই ডেটা সেটে একটি নতুন মডেলকে প্রশিক্ষণ দেওয়া তাই “সবুজ”কে “ব্যাঙ” এর সাথে সংযুক্ত করবে যা পরীক্ষার সেটে অ-তুচ্ছ নির্ভুলতা অর্জন করবে (মন্তব্যে “ফ্যাশন-MNIST থেকে MNIST শেখে” পরীক্ষার অনুরূপ)। এটি ঠিক লেবেল বৈশিষ্ট্যগুলি শেখার জন্য নিজেকে ধার দেয়, যেমন গভীর নেটওয়ার্কগুলি মানব লেখকদের কাছ থেকে একটি ভাল সিদ্ধান্তের সীমানা “পাতন” করে। প্রকৃতপক্ষে, আমরা এই পরীক্ষাগুলিতে বৈশিষ্ট্য পরিমার্জনের একটি খুব আকর্ষণীয় চিত্র খুঁজে পাই যা আমাদের অনুসন্ধানগুলিকে পরিপূরক করে।
আমরা আরও লক্ষ্য করি যে এখানে লজিস্টিক রিগ্রেশনের একটি সাদৃশ্য শুধুমাত্র লিনিয়ার ক্লাসিফায়ারগুলির কম ভিসি মাত্রার কারণেই সম্ভব (অর্থাৎ, এই শ্রেণীবিভাগের মাত্রা রয়েছে ) বিশেষ করে, ভিসি মাত্রা সহ যেকোন শ্রেণীবিভাগ দেওয়া
আমরা অন্তত প্রয়োজন শ্রেণীবিভাগের সম্পূর্ণ গ্রেডের জন্য পয়েন্ট। বিপরীতে, নিউরাল নেটওয়ার্কগুলির একটি অত্যন্ত বড় ভিসি মাত্রা দেখানো হয়েছে (বিশেষত, প্রশিক্ষণ সেটের আকারের চেয়ে বড়
অবশেষে, আমাদের পরীক্ষা-নিরীক্ষার জন্য একমাত্র সম্ভাব্য সমস্যাযুক্ত ব্যাখ্যা (অর্থাৎ, মডেলের যথেষ্ট সামঞ্জস্যপূর্ণ পয়েন্টগুলি একটি শ্রেণীবদ্ধকারীকে পুনরুত্পাদন করতে পারে) প্রীতমের পরীক্ষা দ্বারা খণ্ডন করা হয়েছে বলে মনে হয়। বিশেষ করে, প্রীতম একটি ডেটাসেট ডিজাইন করতে সক্ষম যা ভুল লেবেলযুক্ত ইনপুটগুলিতে প্রশিক্ষিত যা মডেলের সাথে সামঞ্জস্যপূর্ণ
মূল মডেলের রেজোলিউশন সীমা মোটেও পুনরুত্পাদন করে না। আরও সাধারণভাবে, এখানে উন্নত “মডেল পরিমার্জন” দৃষ্টিভঙ্গি নীচের প্রিটাম দ্বারা উত্পন্ন ডেটাসেট এবং স্ট্যান্ডার্ড PGD দ্বারা উত্পন্ন ডেটাসেটের মধ্যে পার্থক্য করতে অক্ষম (যেমন এবং
ডেটাসেট)।