সাইন আপ • আগের সমস্যা
বিজ্ঞান কল্পকাহিনী ছাড়া স্ব-উন্নতি
কয়েক সপ্তাহ আগে আমি লেখা AI সিস্টেমগুলি যেগুলি স্থাপনের পরে শিখতে থাকে সেগুলির পরিবর্তে প্রতিটি মিথস্ক্রিয়াকে একটি নতুন শুরু হিসাবে বিবেচনা করা উচিত। এটি বেশ কয়েকজন পাঠককে এটি সম্পর্কে জিজ্ঞাসা করতে প্ররোচিত করেছিল পুনরাবৃত্ত স্ব-উন্নতি (আরএসআই) সংযোগটি বাস্তব, কিন্তু আমি মনে করি এটি তিনটি ধারণাকে আলাদা করতে সাহায্য করে। ক্রমাগত শিক্ষা অভিজ্ঞতা পরের বার সিস্টেমকে আরও ভাল করে তোলে কিনা তা জিজ্ঞাসা করে। সীমিত স্ব-উন্নতি সিস্টেমকে সেই অভিজ্ঞতাকে একটি পরীক্ষিত এবং দীর্ঘস্থায়ী পরিবর্তনে পরিণত করতে সাহায্য করার মাধ্যমে আরও এগিয়ে যায়। আরএসআই এটি শক্তিশালী দাবি, যেখানে সিস্টেমটি সেই প্রক্রিয়াটিকে উন্নত করে যা প্রথম স্থানে এই উন্নতিগুলি তৈরি করে। এগুলি একটি মইয়ের উপর রঙ্গ নয়। একটি সিস্টেম অন্যদের ছাড়াই করতে পারে।
এই নিউজলেটার পাঠকদের দ্বারা অর্থায়ন করা হয়, বিজ্ঞাপন নয়। একজন অর্থপ্রদানকারী সমর্থক হওয়ার কথা বিবেচনা করুন 
RSI ফ্রন্টিয়ার এআই ল্যাবগুলিতে অনেক মনোযোগ পাচ্ছে কারণ, যদি এটি কাজ করে তবে এটি ভবিষ্যতের মডেলগুলির বিকাশকে ত্বরান্বিত করতে পারে। তবে বেশিরভাগ এআই দল ফ্রন্ট-এন্ড মডেলদের প্রশিক্ষণ দেয় না, তাই তাদের কেন যত্ন নেওয়া উচিত? কারণ কিছু দরকারী এবং ব্যবহারিক সরঞ্জাম সম্পূর্ণ RSI এর অনেক আগেই পৌঁছে যাবে। একটি সিস্টেম যা উত্পাদন ব্যর্থতা থেকে শেখে, তার অ্যাপ্লিকেশন স্ট্যাকের পরিবর্তনের পরামর্শ দেয়, সেগুলি পরীক্ষা করে এবং রক্ষণাবেক্ষণ করে যে কী কাজগুলি এআই অ্যাপ্লিকেশনগুলি তৈরি এবং রক্ষণাবেক্ষণের উপায়কে পরিবর্তন করবে। কাছাকাছি সময়ের গল্পটি এমন একটি বুদ্ধিমত্তা সম্পর্কে কম যা সীমা ছাড়াই নিজেকে উন্নত করে এবং উন্নতি প্রক্রিয়ার স্বয়ংক্রিয় অংশগুলি সম্পর্কে যা আমরা বর্তমানে হাতে করে করি।

জোতা যেখানে লিভার আছে
বেশিরভাগ অ্যাপ্লিকেশন দলের জন্য, আগ্রহের পৃষ্ঠটি মডেল ওজন নয়। এটি সমস্ত মডেলের চারপাশে আবৃত: নির্দেশাবলী, প্রসঙ্গ, মেমরি, সরঞ্জাম, রাউটিং, সাব-এজেন্ট এবং কর্মপ্রবাহ। এই সফটওয়্যার প্রায়ই বলা হয় জোতা. একটি ফ্রন্ট-এন্ড মডেলের বিপরীতে, এটি এমন কিছু যা আপনার দল সত্যিই মালিক, এবং এটি পরিবর্তন করা, পরীক্ষা করা এবং প্রত্যাবর্তন করাও অনেক সহজ। একটি পরীক্ষা একটি মডেলকে মোটেও স্পর্শ না করে 40 শতাংশ পাসের হার থেকে 62 শতাংশে নিয়ে গেছে। অন্য একজন খুঁজে পেয়েছেন যে এজেন্টরা কীভাবে তথ্য আদান-প্রদান করে তার পুনর্গঠন ফলাফলের উন্নতি করতে পারে যখন অনুমান খরচ 60 শতাংশ পর্যন্ত কমাতে পারে।

এটি আমাকে একটি পয়েন্ট মনে করিয়ে দেয় পূর্ববর্তী: দলগুলিকে একটি নতুন বা বড় মডেলের জন্য পৌঁছানোর মাধ্যমে যেকোন পারফরম্যান্স সমস্যার সমাধান করতে প্রতিফলনকে প্রতিরোধ করা উচিত। প্রায়শই ভাল বিনিয়োগ মডেলের চারপাশে সিস্টেমের উন্নতি করে। প্রোডাকশন ট্রেসগুলি পুনরাবৃত্ত ব্যর্থতা প্রকাশ করতে পারে এবং একজন এজেন্ট ক্রমবর্ধমানভাবে নির্ণয় করতে সাহায্য করতে পারে যে ফিক্সটি মেমরি, নির্দেশাবলী, টুল ব্যবহার, রাউটিং বা ওয়ার্কফ্লো ডিজাইনের অন্তর্গত কিনা। আমি পাইকারি পুনর্লিখনের অনুমতি না দিয়ে ছোট পরিবর্তন দিয়ে শুরু করব। মেমরি আপডেট করা বা রাউটিং পরিবর্তন করা একটি এজেন্টকে তার সম্পূর্ণ অপারেটিং পরিবেশকে পুনরায় ডিজাইন করতে দেওয়ার চেয়ে বোঝা এবং বিপরীত করা অনেক সহজ।
কেন লুপ তোমাকে মিথ্যা বলতে পারে
একজন প্রার্থীর উন্নতি তৈরি করা সহজ এবং সস্তা হয়ে যায়। এটি সত্যিই ভাল কিনা তা জানা অনেক বেশি কঠিন। এন্টারপ্রাইজ অ্যাপ্লিকেশনগুলিতে, যে জিনিসটি পরিমাপ করা সবচেয়ে সহজ তা সাধারণত ব্যবসার আগ্রহের জিনিস নয়। আরও সমর্থন টিকিট বন্ধ করার অর্থ অগত্যা খুশি গ্রাহকদের নয়। আরো বিক্রয় কার্যকলাপ অগত্যা আরো আয় মানে না. একটি স্ব-উন্নতি লুপ প্রক্সি অপ্টিমাইজেশানে খুব ভাল হতে পারে যখন আসল লক্ষ্য সবেমাত্র নড়াচড়া করে। এটি মূল্যায়নকে পণ্যের আর্কিটেকচারের অংশ করে তোলে, এমন কিছু নয় যা আপনি পরে পালিয়ে যান।

আপনি লুপ যত বেশি স্বায়ত্তশাসন দেবেন, তার নাগালের বাইরে কোনো মূল্যায়ন রাখা তত গুরুত্বপূর্ণ. একটি পরীক্ষা আত্মসম্মান এবং বাস্তবতার মধ্যে একটি বড় ব্যবধান খুঁজে পেয়েছে। সিস্টেমগুলি নিজেদেরকে উন্নত হিসাবে রেট করেছে যখন স্বাধীন পরীক্ষায় দেখা গেছে যে অনেকগুলি ছিল না। অন্য একটি পরীক্ষায়, স্কোর উন্নত হয়েছে কারণ এজেন্ট হ্যালুসিনেশন ডিটেক্টর দ্বারা পতাকাঙ্কিত হওয়া এড়াতে শিখেছে, কারণ সে কম হ্যালুসিনেশন করছে না। এখানে রহস্যময় কিছুর প্রয়োজন নেই। এটি একটি দ্রুত অপ্টিমাইজার সহ একটি নিয়মিত মেট্রিক গেম৷ আমি পরীক্ষাগুলিকে সুরক্ষিত রাখব, প্রতিবার প্রোডাকশন যখন নতুন ব্যর্থতা প্রকাশ করবে তখন রিগ্রেশন স্যুট বাড়াব এবং এটিকে রোল ব্যাক করা সহজ করব।
যেখানে স্ব-উন্নতি প্রথমে কাজ করে
সেরা প্রাথমিক লক্ষ্যগুলি একটি সাধারণ সম্পত্তি ভাগ করে: পরিবেশ সিস্টেমকে বলতে পারে যদি কোনো পরিবর্তন সাহায্য করে। কোড কম্পাইল বা না. পরীক্ষায় পাস বা ফেল। গেম স্কোর আছে. চিপ ডিজাইনে সিমুলেটর এবং ইঞ্জিনিয়ারিং সীমাবদ্ধতা রয়েছে। এই পরিবেশগুলি সিস্টেমকে অনেক পরিবর্তনের চেষ্টা করার এবং তুলনামূলকভাবে দ্রুত প্রতিক্রিয়া পাওয়ার অনুমতি দেয়। উন্মুক্ত জ্ঞানের কাজটি আরও কঠিন কারণ “ভাল” বিচারের উপর নির্ভর করতে পারে যা ধীর, বিষয়ভিত্তিক বা কয়েক মাস পরে দৃশ্যমান। এছাড়াও একটি দ্বিতীয় সিলিং আছে। আরও ভাল নির্দেশিকা এবং কর্মপ্রবাহ একটি মডেলকে কীভাবে করতে হবে তা ইতিমধ্যেই জানে তার আরও ভাল ব্যবহার করতে সাহায্য করতে পারে। তারা এটির ক্ষমতা দিতে পারে না যা এটির নেই।

উত্পাদন সিস্টেমের জন্য, আমি প্রতিটি প্রস্তাবিত উন্নতিকে একটি সফ্টওয়্যার রিলিজ হিসাবে বিবেচনা করব। একজন প্রার্থী তৈরি করুন, স্বাধীনভাবে এটি পরীক্ষা করুন, এটি পাস করলেই এটি প্রচার করুন, পূর্ববর্তী সংস্করণটি উপলব্ধ রাখুন এবং ফলাফলগুলি উল্লেখযোগ্য হলে মানুষের অনুমোদনের প্রয়োজন৷ কিছু জিনিস শুধুমাত্র সম্পাদনাযোগ্য স্তরের বাইরে থাকা উচিত, যার মধ্যে অনুমতি, নিরাপত্তা সীমানা, ব্যয়ের সীমা এবং নিয়ন্ত্রণগুলি যা উৎপাদনে যায় তা নির্ধারণ করে। যেহেতু মেশিনগুলি আরও বেশি পরীক্ষা-নিরীক্ষা গ্রহণ করে, মানুষের কাজ লক্ষ্য নির্বাচনের দিকে, মূল্যায়নের পরিবেশ ডিজাইন করা এবং কোন ঝুঁকিগুলি গ্রহণযোগ্য তা সিদ্ধান্ত নেওয়ার দিকে এগিয়ে যায়।
পুনরাবৃত্তির আগে অর্থনীতি গুরুত্বপূর্ণ হতে পারে
স্ব-উন্নতি থেকে প্রথম লাভ হবে সস্তা এআই, স্মার্ট এআই নয়. কিছু শক্তিশালী উদাহরণের মধ্যে একটি ভাল জোতা রয়েছে যা অনুমান খরচ কমায়, বা একটি ছোট একটি বিশেষ মডেলের ভাল কর্মক্ষমতা একটি সংকীর্ণ কর্মপ্রবাহে একটি অনেক বড় সাধারণ মডেল। একবার একটি কাজ পর্যাপ্ত বার পুনরাবৃত্তি করা হলে এবং এর ফলাফল পরিমাপযোগ্য হলে, এটি সরাসরি সেই কাজের জন্য অপ্টিমাইজ করা যেতে পারে আরো আকর্ষণীয় চেয়ে ক্রমাগত কেনাকাটা আরো সাধারণ ক্ষমতা। উন্নতি লুপ চালানোর জন্য একটি মূল্য আছে. এজেন্ট ট্রেস বিশ্লেষণ, বিকল্প তৈরি, এবং মূল্যায়ন চলমান কম্পিউটিং ব্যবহার করে, এবং বেশিরভাগ প্রস্তাবিত পরিবর্তন বাতিল করা হয়। সঠিক তুলনা হল প্রকৌশল কাজের তুলনায় সেই পরীক্ষার খরচ, অনুমান খরচ এবং এটি প্রতিস্থাপন করা বারবার ব্যর্থতা।

আরও আকর্ষণীয় দীর্ঘমেয়াদী সম্পত্তি লুপ জমা হয় ইতিহাস. প্রোডাকশন ট্রেসগুলি বাগ নিষ্কাশন হওয়া বন্ধ করে এবং পরবর্তী প্রকাশের জন্য কাঁচামাল হয়ে উঠতে শুরু করে৷ ব্যর্থতা রিগ্রেশন পরীক্ষায় পরিণত হয়। সফল কৌশলগুলি পুনরায় ব্যবহারযোগ্য দক্ষতায় পরিণত হয়। প্রত্যাখ্যান করা পরিবর্তনগুলি সিস্টেমকে বলে যে কি আবার চেষ্টা করা উচিত নয়। এর কোনোটিরই সম্পূর্ণ RSI প্রয়োজন নেই। ব্যবহারিক সংস্করণটি একটি স্বয়ংক্রিয় উন্নতি পাইপলাইন সংযুক্ত সহ একটি আধুনিক সফ্টওয়্যারের মতো দেখায়। ভুলে যান যখন পুনরাবৃত্ত স্ব-উন্নতি আসে। আপনার অনুরোধ অর্থবহ হবে? 500 দিনে আরও ভাল সব কিছুর কারণেই প্রথম দিন এবং তারপরের মধ্যে তিনি মুখোমুখি হন?
এই অংশটি বর্ণনা করে হার্নেস, এক্সচেঞ্জ লুপ এবং প্রত্যাহার সিস্টেম নির্মাণকারী ক্রুরা এই ঘরে থাকবে এআই সম্মেলনসান ফ্রান্সিসকো, সেপ্টেম্বর 30-অক্টোবর 1. ব্যবহার গ্রেডিয়েন্টফ্লো20 20% ডিসকাউন্টে।
চীনের কৃত্রিম বুদ্ধিমত্তা বিকাশের প্যারাডক্স

পোস্ট আপনার AI মডেল একটি ভাড়া (কিন্তু লুপ একটি সম্পদ) প্রথম গ্রেডিয়েন্ট ফ্লো প্রদর্শিত.