ভিডিও ওয়ার্ল্ড মডেল, যা ভবিষ্যত ফ্রেমের ভবিষ্যদ্বাণী করে ক্রিয়াকলাপের উপর, কৃত্রিম বুদ্ধিমত্তার জন্য প্রচুর প্রতিশ্রুতি রাখে, এজেন্টদের গতিশীল পরিবেশে পরিকল্পনা করতে এবং যুক্তি দিতে সক্ষম করে। সাম্প্রতিক অগ্রগতি, বিশেষ করে ভিডিও স্ক্যাটারিং মডেলগুলির সাথে, বাস্তবসম্মত ভবিষ্যত ক্রম তৈরিতে চিত্তাকর্ষক ক্ষমতা দেখিয়েছে। যাইহোক, একটি উল্লেখযোগ্য বাধা রয়ে গেছে: দীর্ঘমেয়াদী স্মৃতি ধরে রাখা। প্রথাগত মনোযোগী স্তরগুলি ব্যবহার করে প্রসারিত ক্রম প্রক্রিয়াকরণের সাথে যুক্ত উচ্চ গণনামূলক খরচের কারণে বর্তমান মডেলগুলি অতীতের দূরবর্তী ঘটনা এবং পরিস্থিতি মনে রাখতে সংগ্রাম করে। এটি তাদের জটিল কাজগুলি সম্পাদন করার ক্ষমতাকে সীমিত করে যার জন্য একটি দৃশ্যের ক্রমাগত বোঝার প্রয়োজন হয়।
স্ট্যানফোর্ড ইউনিভার্সিটি, প্রিন্সটন ইউনিভার্সিটি এবং অ্যাডোব রিসার্চের গবেষকদের দ্বারা “ওয়ার্ল্ড ভিডিও স্টেট-স্পেস লং মডেলস” একটি নতুন কাগজ এই চ্যালেঞ্জের একটি উদ্ভাবনী সমাধান প্রদান করে। তারা একটি উদ্ভাবনী স্থাপত্য উপস্থাপন করে যা লিভারেজ করে স্টেট-স্পেস মডেল (SSMs) কম্পিউটেশনাল দক্ষতা বলিদান ছাড়াই অস্থায়ী মেমরি প্রসারিত করুন।
মূল সমস্যাটি অনুক্রমের দৈর্ঘ্যের সাথে মনোযোগের প্রক্রিয়াগুলির দ্বিঘাত গণনাগত জটিলতার মধ্যে রয়েছে। ভিডিও সংযোগ বাড়ার সাথে সাথে মনোযোগ স্তরগুলির জন্য প্রয়োজনীয় সংস্থানগুলি বিস্ফোরিত হয়, যা বাস্তব বিশ্বের অ্যাপ্লিকেশনগুলির জন্য দীর্ঘমেয়াদী মেমরিকে অব্যবহারিক করে তোলে৷ এর মানে হল যে নির্দিষ্ট সংখ্যক ফ্রেমের পরে, মডেলটি কার্যকরভাবে আগের ঘটনাগুলিকে “ভুলে যায়”, যা বর্ধিত সময়ের জন্য সুসংহততা বা দীর্ঘমেয়াদী যুক্তির প্রয়োজন হয় এমন কাজগুলিতে এর কার্যকারিতাকে বাধা দেয়।
লেখকদের মূল অন্তর্দৃষ্টি হল কার্যকারণ সিকোয়েন্স মডেলের জন্য স্টেট-স্পেস মডেলের (SSMs) অন্তর্নিহিত শক্তিগুলিকে কাজে লাগানো। পূর্ববর্তী প্রচেষ্টার বিপরীতে যেগুলি SSM সিস্টেমগুলিকে অ-কারণমূলক দৃষ্টি কার্যগুলিতে পুনরায় অভিযোজিত করেছিল, এই কাজটি দক্ষ ক্রম প্রক্রিয়াকরণে তাদের সুবিধার সম্পূর্ণ সুবিধা নেয়।
প্রস্তাবিত লং কনটেক্সট স্টেট-স্পেস ভিডিও ওয়ার্ল্ড মডেল (LSSVWM) বেশ কয়েকটি প্রয়োজনীয় নকশা বিকল্প একত্রিত করে:
- ব্লকিং এ এসএসএম স্ক্যান প্রোগ্রাম: এটি তাদের নকশার কেন্দ্রবিন্দু। একটি একক SSM স্ক্যানের মাধ্যমে সম্পূর্ণ ভিডিও ক্রম প্রক্রিয়াকরণের পরিবর্তে, তারা একটি ব্লক প্রোগ্রাম ব্যবহার করে। এটি কৌশলগতভাবে উল্লেখযোগ্যভাবে প্রসারিত অস্থায়ী স্মৃতির জন্য কিছু স্থানিক সামঞ্জস্য (একটি ব্লকের মধ্যে) ব্যবসা করে। দীর্ঘ ক্রমকে পরিচালনাযোগ্য ব্লকে ভেঙে দিয়ে, তারা একটি সংকুচিত “স্থিতি” বজায় রাখতে পারে যা ব্লক জুড়ে তথ্য বহন করে, কার্যকরভাবে মডেলের মেমরি দিগন্তকে প্রসারিত করে।
- ঘন স্থানীয় মনোযোগ: ব্লক SSM স্ক্যানিং দ্বারা প্রবর্তিত স্থানিক সমন্বয়ের সম্ভাব্য ক্ষতির জন্য ক্ষতিপূরণের জন্য, মডেলটি ঘন স্থানীয় মনোযোগ অন্তর্ভুক্ত করে। এটি নিশ্চিত করে যে ব্লকগুলির মধ্যে এবং জুড়ে ক্রমাগত ফ্রেমগুলি দৃঢ় সম্পর্ক বজায় রাখে এবং বাস্তবসম্মত ভিডিও তৈরি করার জন্য প্রয়োজনীয় সূক্ষ্ম বিবরণ এবং ধারাবাহিকতা বজায় রাখে। গ্লোবাল প্রসেসিং (SSM) এবং স্থানীয় প্রক্রিয়াকরণ (মনোযোগ) এর এই দ্বৈত পদ্ধতি তাদের দীর্ঘমেয়াদী স্মৃতি এবং স্থানীয় বিশ্বস্ততা উভয়ই অর্জন করতে দেয়।

দীর্ঘ প্রেক্ষাপটে কর্মক্ষমতা আরও উন্নত করতে নিবন্ধটি দুটি মূল প্রশিক্ষণ কৌশলও উপস্থাপন করে:
- বিস্তার জোরপূর্বক: এই কৌশলটি মডেলটিকে ইনপুটের উপসর্গের উপর শর্তযুক্ত ফ্রেম তৈরি করতে উত্সাহিত করে, যার ফলে এটি কার্যকরভাবে দীর্ঘ সময়ের জন্য ধারাবাহিকতা বজায় রাখতে শিখতে বাধ্য করে। কখনও কখনও একটি উপসর্গের নমুনা না নিয়ে এবং সমস্ত টোকেনকে শব্দে না রেখে, প্রশিক্ষণটি একটি প্রসারণ সীমাবদ্ধতার সমতুল্য হয়ে ওঠে, যা একটি দীর্ঘ প্রেক্ষাপটের সাথে প্রশিক্ষণের একটি বিশেষ ক্ষেত্রে হাইলাইট করা হয় যেখানে উপসর্গের দৈর্ঘ্য শূন্য। এটি ন্যূনতম প্রাথমিক প্রসঙ্গ থেকেও সুসংগত ক্রম তৈরি করতে মডেলটিকে ঠেলে দেয়।
- স্থানীয় মনোযোগ কাঠামো: দ্রুত প্রশিক্ষণ এবং নমুনা নেওয়ার জন্য, লেখকরা “ফ্রেমে স্থানীয় মনোযোগ” প্রক্রিয়া প্রয়োগ করেছেন। এটি একটি সম্পূর্ণ কার্যকারণ মুখোশের তুলনায় উল্লেখযোগ্য গতি অর্জন করতে ফ্লেক্সঅ্যাটেনশন ব্যবহার করে। ফ্রেমগুলিকে খণ্ডে বিভক্ত করে (যেমন, 10-এর ফ্রেমের উইন্ডোর আকার সহ 5-এর খণ্ড), একটি খণ্ডের মধ্যে থাকা ফ্রেমগুলি দ্বিমুখীতা বজায় রাখে এবং আগের খণ্ডে ফ্রেমগুলিকে উল্লেখ করে৷ কম্পিউটেশনাল লোড অপ্টিমাইজ করার সময় এটি একটি দক্ষ প্রাপ্তি ক্ষেত্র সক্ষম করে।

গবেষকরা তাদের LSSVWM-কে চ্যালেঞ্জিং ডেটাসেটের উপর মূল্যায়ন করেছেন, সহ একটি স্মৃতি গোলকধাঁধা এবং মাইনক্রাফ্টযা বিশেষভাবে পুনরুদ্ধার এবং স্থানিক বিচার কার্যের মাধ্যমে দীর্ঘমেয়াদী মেমরি ক্ষমতা পরীক্ষা করার জন্য ডিজাইন করা হয়েছে।
পরীক্ষাগুলি প্রমাণ করে যে তাদের পদ্ধতি উল্লেখযোগ্যভাবে বেসলাইন অতিক্রম করে দীর্ঘমেয়াদী স্মৃতি ধারণে। গুণগত ফলাফল, যেমন পরিপূরক চিত্রগুলিতে দেখানো হয়েছে (যেমন, S1, S2, S3), চিত্রিত করে যে LSSVWM ফ্রেমে স্থানীয় মনোযোগ ছাড়াই শুধুমাত্র কার্যকারণ মনোযোগ বা এমনকি Mamba2-এর উপর নির্ভর করে এমন মডেলগুলির তুলনায় বর্ধিত সময়ের জন্য আরও সুসঙ্গত এবং সঠিক ক্রম তৈরি করতে পারে। উদাহরণস্বরূপ, গোলকধাঁধা ডেটাসেটের জন্য যুক্তিযুক্ত কাজগুলিতে, তাদের মডেল দীর্ঘ দিগন্তে আরও ভাল ধারাবাহিকতা এবং নির্ভুলতা বজায় রাখে। একইভাবে, পুনরুদ্ধারের কাজগুলির জন্য, LSSVWM দূরবর্তী অতীতের ফ্রেমগুলি থেকে তথ্য মনে রাখার এবং ব্যবহার করার একটি উন্নত ক্ষমতা দেখায়। গুরুত্বপূর্ণভাবে, ব্যবহারিক অনুমান গতি বজায় রাখার সময় এই উন্নতিগুলি অর্জন করা হয়, মডেলগুলিকে ইন্টারেক্টিভ অ্যাপ্লিকেশনের জন্য উপযুক্ত করে তোলে।

কাগজ দীর্ঘ-সম্পর্কের রাষ্ট্র-স্থানের প্রেক্ষাপট সহ ভিডিও বিশ্ব মডেল arXiv এ পাওয়া গেছে
পোস্ট অ্যাডোব রিসার্চ স্টেট-স্পেস মডেলগুলির সাথে ভিডিও ওয়ার্ল্ড মডেলগুলিতে দীর্ঘমেয়াদী মেমরি আনলকিং প্রথম দেখায় সিঙ্ক করা হয়েছে৷
Source link