রেস্তোরাঁ, ক্যাফে এবং ব্র্যান্ডগুলি থেকে অপ্রীতিকর জাঙ্কের বন্যা আসছে যা তাদের খাবারের প্রচার করে এমন চিত্র তৈরি করতে ক্রমবর্ধমানভাবে এআই-এর দিকে ঝুঁকছে। এর ফলে হরর শোতে চিংড়ির ডোনাট, গভীরের একটি রুবেন, কীটের মতো নুডলস এবং নুডলের মতো পেস্ট্রি এবং স্ট্রিং চিকেন অন্তর্ভুক্ত রয়েছে। এছাড়াও বিল্ডিং উপকরণগুলি আইসক্রিম হিসাবে ছদ্মবেশী, আইসক্রিম একটি মস্তিষ্ক হিসাবে মাস্করাডিং এবং বিল্ডিং সংলগ্ন আরেকটি রান্নাঘর রয়েছে। আমি এমনকি জানি না কীভাবে এই দানবীয় বার্গারের অভিজ্ঞতা বর্ণনা করতে শুরু করব, এবং নরক, জাঙ্ক এবং সমস্ত কিছু থেকে ট্রাইপোফোবিক বুরিটো সম্পর্কে যত কম বলা যায় তত ভাল। গলদ আছে। এবং গর্ত. এত গর্ত।
“ডিফিউশন মডেলগুলি পাতলা, অবিচ্ছিন্ন, সসীম কাঠামো তৈরিতে কুখ্যাতভাবে দুর্বল।”
আমরা সাধারণত জানি না কেন কেউ এমন কিছু বিক্রি করতে AI স্লপ ব্যবহার করবে যা ক্ষুধার্ত দেখাবে, বিশেষ করে যখন খাবারটি সম্ভবত একটি ছবি তোলার জন্য থাকে। কিন্তু কৃত্রিম বুদ্ধিমত্তা কেন এই ধরনের অসুস্থ ছবি তৈরি করতে এত ভাল সে সম্পর্কে আমরা কিছুটা জানি।
AI সিস্টেমগুলি কীভাবে ইমেজ তৈরি করে তার প্রযুক্তিগত সূক্ষ্মতা থেকে শুরু করে মনস্তাত্ত্বিক চার্জের জন্য তাদের প্রশিক্ষণ দেওয়ার জন্য ব্যবহৃত উপকরণ যা মানুষ ছবিগুলিকে উপলব্ধি করে তার অনেকগুলি কারণ রয়েছে। প্রায়শই শুরু থেকেই সমস্যা শুরু হয়। অনেক টপ ইমেজ জেনারেটর ডিফিউশন ব্যবহার করে ছবি তৈরি করে। সহজভাবে বলতে গেলে, ডিফিউশন মডেলগুলি বিশুদ্ধ শব্দের একটি চিত্র দিয়ে শুরু হয়—অচলের পূর্ণ পর্দার মতো কিছু—এবং কাঙ্খিত ভিজ্যুয়াল তৈরি করতে ধীরে ধীরে শব্দগুলিকে অল্প অল্প করে সরিয়ে দেয়। অক্সফোর্ড বিশ্ববিদ্যালয়ের কৃত্রিম বুদ্ধিমত্তা, শাসন ও নীতির অধ্যাপক এবং কম্পিউটার ভিশনের বিশেষজ্ঞ ক্রিস রাসেল ব্যাখ্যা করেছেন, “এর মানে হল যে প্রাথমিকভাবে মোটা কাঠামোগুলি প্রথমে সূক্ষ্ম টেক্সচারের বিবরণ দিয়ে পুনরুদ্ধার করা হয়।”
রাসেল বলেছিলেন যে এই বিরক্তিকর খাবারের অনেক ফটোতে, এই ছোট বিবরণ যোগ করার সময় জিনিসগুলি ইতিমধ্যেই ভুল হয়ে গেছে। মডেলটি আগের পর্যায়ে একটি বস্তুর মৌলিক কাঠামোকে মিথ্যা করতে পারে, তারপর সেই কাঠামোর উপরে লাইভ টেক্সচারের বিবরণ তৈরি করতে পারে। “এটি একই ধরণের ব্যর্থতা যা আপনি দেখতে পান যখন একজন ব্যক্তিকে পাঁচটির পরিবর্তে ছয়টি আঙ্গুল দিয়ে তৈরি করা হয়,” রাসেল বলেছিলেন। (এটি ডোনাট চিংড়ি ব্যাখ্যা করতে পারে।)
মডেলটি আগের পর্যায়ে একটি বস্তুর মৌলিক কাঠামোকে মিথ্যা করতে পারে, তারপর সেই কাঠামোর উপরে লাইভ টেক্সচারের বিবরণ তৈরি করতে পারে।
এমনকি যখন মৌলিক কাঠামো শক্ত হয়, সূক্ষ্ম বিবরণ তাদের উপায়ে ভুল হতে পারে, বলেছেন জিওভানাবাটিস্তা ক্যালিফানো, একজন আচরণগত বিজ্ঞানী যিনি ইতালির নেপলস ফেদেরিকো II বিশ্ববিদ্যালয়ের AI-উত্পন্ন চিত্রগুলির প্রতিক্রিয়া অধ্যয়ন করেন। “ডিফিউশন মডেলগুলি পাতলা, অবিচ্ছিন্ন এবং সমাপ্ত কাঠামো তৈরিতে দুর্বল বলে পরিচিত,” তিনি বলেছিলেন। “নুডুলস, স্ট্র্যান্ডস এবং টেন্ড্রিলগুলি ঠিক এক ধরণের জ্যামিতি যা এটিকে বাধা দেয়, তাই আপনি স্প্যাগেটির মতো বস্তুগুলি পান যেগুলি এমন জায়গায় রক্তপাত করে যা কোনও শারীরবৃত্তীয় বা রন্ধনসম্পর্কিত অর্থবোধ করে না।” অন্য কথায়, একবার একটি মডেল এইরকম কিছু তৈরি করা শুরু করলে, এটি কোথায় থামানো উচিত বা এটির সাথে সংযুক্ত হওয়া উচিত তা খুঁজে বের করতে সমস্যা হতে পারে। বুদবুদ এবং বীজের মতো অন্যান্য পুনরাবৃত্ত টেক্সচারগুলি ডিফিউশন মডেলগুলিকে বোধগম্য সীমানায় ফিট করা কঠিন, তিনি যোগ করেছেন, যার অর্থ তারা প্রায়শই এমন জায়গায় ছড়িয়ে পড়ে যেগুলি হওয়া উচিত নয়। এটি ব্যাখ্যা করতে সাহায্য করে যে কেন এত AI ফুড ইমেজ এত নির্দয়, বিরক্তিকরভাবে ডিজাইন করা হয়েছে এবং ক্লাস্টারড ছিদ্রে পূর্ণ যা ট্রাইপোফোবিয়াকে প্ররোচিত করতে পারে।
এটি সাহায্য করে না যে AI এর কোনও ধারণা নেই যে স্যান্ডউইচ আসলে কী। বা নুডলস। বা একটি burrito. তিনি যে বস্তুগুলি তৈরি করেন বা তারা যে ভৌত জগতে বাস করে সে সম্পর্কে তার কোনও বোধগম্যতা নেই। তিনি শিখেছেন, সাধারণভাবে, পরিসংখ্যানগত স্তরে এই জিনিসগুলি কেমন দেখায়, তবে কেন সেগুলি সেভাবে দেখায় বা কীভাবে তাদের আচরণ করা উচিত তা নয়। সুইজারল্যান্ডের জুরিখ বিশ্ববিদ্যালয়ের ডিজিটাল সংস্কৃতি ও কলা বিভাগের অধ্যাপক রোল্যান্ড মায়ার ব্যাখ্যা করেছেন, “এআই ইমেজ প্রজন্ম বিশ্বের সঠিক জ্ঞান ছাড়াই একটি দৃশ্য পুনরুত্পাদন করে।” ফলাফল হল খাবারের একটি আনুমানিক অনুমান যা জিনিসটি নিজেই বোঝার থেকে বিচ্ছিন্ন।
কিংস কলেজ লন্ডনের কম্পিউটার সায়েন্সের একজন সিনিয়র লেকচারার মাইকেল কুক বলেছেন, এই বোঝার অভাব ইমেজগুলির মানব দর্শকদের দ্বারা কিছু অন্ত্র-বিধ্বংসী নান্দনিক ব্যাখ্যার দিকে নিয়ে যেতে পারে। তাই আইসক্রিম যা ফাটা কংক্রিটের কথা মনে করিয়ে দেয়, বা হ্যামবার্গার যা পাথরের তৈরি বলে মনে হয়। AI মডেলগুলির কোনও বোধগম্যতা নেই কেন খাদ্য এইভাবে অন্যান্য অ-খাদ্য চিত্রগুলির মতো দেখা উচিত নয়। “এই টেক্সচারগুলি যদি স্থাপত্য প্রসঙ্গে ব্যবহার করা হয় তবে এটি সম্পূর্ণ স্বাভাবিক দেখতে পারে,” কুক ব্যাখ্যা করেছিলেন। “কিন্তু যখন আমরা এটিকে ভোজ্য খাবার হিসাবে কল্পনা করি তখন তারা ভুল হয়ে যায়।”
এই মডেলগুলিকে প্রশিক্ষণ দেওয়ার জন্য ব্যবহৃত চিত্রগুলি সমস্যাটিকে আরও বাড়িয়ে তুলতে পারে। “কারণ আমরা এই সিস্টেমগুলির প্রশিক্ষণ প্রক্রিয়াগুলি সম্পর্কে খুব কমই জানি, আমরা সত্যিই জানি না যে তারা কোন বিষয়বস্তুর মিশ্রণটি গ্রহণ করে বা তারা কোন সংস্থাগুলি তৈরি করে,” কুক বলেছিলেন।
ফুড ফটোগ্রাফি প্রায়শই খুব স্টাইলাইজড, তীক্ষ্ণ বৈপরীত্য, উজ্জ্বল রং, উজ্জ্বল আলো এবং অতিরঞ্জিত আকারে পূর্ণ। কখনও কখনও “খাদ্য” ছবি তোলা হচ্ছে এমনকি খাবার নয়। মায়ার বলেছিলেন যে এআই মডেলগুলি এই পৃষ্ঠের গুণাবলী এবং ভিজ্যুয়াল কনভেনশনগুলি বেছে নিতে পারে তবে তাদের পিছনের প্রসঙ্গ না বুঝেই তাদের পুনরুত্পাদন করতে পারে। “অন্য কথায়, এআই ইমেজ তৈরি ফটোগ্রাফির চেহারাকে পুরোপুরি অনুকরণ করে, কিন্তু এর পেশাদার নান্দনিক কৌশল নয়,” মায়ার বলেন। “এটাই শেষ পর্যন্ত তাদের এত বিরক্তিকর করে তোলে।”
এটি সাহায্য করে না যে AI এর কোনও ধারণা নেই যে স্যান্ডউইচ আসলে কী। বা নুডলস। বা একটি burrito.
শৈলী একদিকে, ওয়েব ট্যুর থেকে বিশ্ব সম্পর্কে শেখার ক্ষেত্রে আরেকটি সমস্যা রয়েছে: জিনিসগুলি দ্রুত অদ্ভুত হতে পারে। লন্ডনের কুইন মেরি ইউনিভার্সিটির কম্পিউটেশনাল সৃজনশীলতা, গেমস এবং কৃত্রিম বুদ্ধিমত্তার অধ্যাপক সাইমন কোল্টন বলেছেন, উদাহরণস্বরূপ, সাধারণ লাল আপেলের তুলনামূলকভাবে কম ছবি থাকতে পারে। “কে ইন্টারনেটে বিরক্তিকর আপেলের ছবি পোস্ট করতে চাইবে?” অদ্ভুত ইমেজ, এদিকে, রেডডিটের মতো সোশ্যাল মিডিয়া প্ল্যাটফর্মগুলিতে বড় শ্রোতাদের খুঁজে পেতে পারে বা মেম হিসাবে ব্যাপকভাবে ছড়িয়ে পড়তে পারে। অদ্ভুত ইন্টারনেট তথ্য এবং মস্তিষ্কের পচা মানে হল একটি AI মডেলের খাবারের চারপাশে অ্যাসোসিয়েশনের একটি অদ্ভুত সংগ্রহ থাকতে পারে এবং এটি কেমন হওয়া উচিত।
কুক বলেছিলেন যে এটি সুপরিচিত যে এআই সিস্টেমগুলিকে এখন এআই-উত্পন্ন উপাদানের উপরও প্রশিক্ষণ দেওয়া হচ্ছে। অনেক জনপ্রিয় AI জিনিসের সাথে খাবার জড়িত, কুক বলেছেন, মানুষ খাবারের স্তূপে বা ঝাঁপিয়ে পড়ার AI ভিডিওগুলির প্রবণতাকে স্মরণ করে। কখনও কখনও উপাদান নিজেই পরাবাস্তব প্রকৃতির বাইরে, অধ্যয়নগুলি ইঙ্গিত দেয় যে অন্যান্য মডেলের আউটপুটগুলিতে AI মডেলগুলিকে প্রশিক্ষণ দেওয়া এক ধরণের “মডেল পতন” ঘটাতে পারে, যার ফলাফল এক ধরণের ভিজ্যুয়াল অবক্ষয় হতে পারে এবং চিত্রগুলির মধ্যে অভিন্নতা বৃদ্ধি করতে পারে।
যেভাবে ছবি তৈরি এবং ব্যবহার করা হয় তা পরিস্থিতিকে আরও খারাপ করে তুলতে পারে। নির্দেশিকা – উভয়ই ব্যবহারকারীদের দ্বারা লিখিত এবং সিস্টেম-স্তরের নির্দেশিকা যা কোম্পানিগুলি তাদের মডেলগুলিকে গাইড করতে ব্যবহার করে – সর্বদা সেরা ফলাফল দেবে না৷ সেগুলি অস্পষ্ট হতে পারে, যেমন শুধু একটি স্যান্ডউইচ চাওয়া, অথবা “ডাইক” এর মতো ভাষা ধারণ করে যা পাঠ্যের জন্য অর্থপূর্ণ, কিন্তু চিত্র তৈরি করার জন্য খুব বেশি অর্থবোধ করে না। লো-রেজোলিউশনের ছবিগুলিকেও তাদের উদ্দেশ্য করা আকারের অনেক বেশি উড়িয়ে দেওয়া যেতে পারে, যে কোনও বিরক্তিকর অপূর্ণতাকে বড় করে যা অন্য বার্তা এড়িয়ে যেতে পারে বা একটি শূন্যতা তৈরি করে যা একটি মডেল পূরণ করতে বাকি থাকে, প্রায়শই অসম্পূর্ণভাবে।
অদ্ভুত ইন্টারনেট তথ্য এবং মস্তিষ্কের পচা মানে হল একটি AI মডেলের খাবারের চারপাশে অ্যাসোসিয়েশনের একটি অদ্ভুত সংগ্রহ থাকতে পারে এবং এটি কেমন হওয়া উচিত।
এই সবগুলি AI-উত্পাদিত খাবারের ছবিগুলিকে অদ্ভূত উপত্যকার গভীরে ঠেলে দেয়৷ এবং দুর্ভাগ্যবশত আমাদের জন্য, মানুষ যখন খাবার সঠিক দেখায় না তখন তা লক্ষ্য করার জন্য বেদনাদায়কভাবে সজ্জিত নয়। বিজ্ঞানীরা বিশ্বাস করেন যে বিতৃষ্ণা আংশিকভাবে পরজীবী, প্যাথোজেন, টক্সিন এবং অন্যান্য সম্ভাব্য হুমকি থেকে আমাদের রক্ষা করার উপায় হিসাবে বিবর্তিত হয়েছে, যা আমাদের বিশেষ করে যখন কিছু খাওয়ার জন্য অনিরাপদ হতে পারে তখন আমাদেরকে বিশেষভাবে আনুষঙ্গিক করে তোলে। ক্যালিফানো বলেছেন যে এটি অস্বাভাবিক উপত্যকাটিকে আমরা অ-বাস্তব মানুষের সাথে যা অভিজ্ঞতা করি তার চেয়ে আরও বেশি অন্ত্র-বিক্ষত করে তোলে।
এআই-উত্পন্ন খাদ্যের একযোগে এই ট্রিগারগুলির অনেকগুলিকে আঘাত করার একটি বিরক্তিকর ক্ষমতা রয়েছে। অদ্ভুত নুডল টেন্ড্রিলগুলি কৃমি বা পরজীবীদের অনুরূপ, গর্তের ক্লাস্টারগুলি সংক্রমণের পরামর্শ দেয় এবং রঙ এবং গঠন দূষণ বা নষ্ট হওয়ার সংকেত দেয় না। এআই-উত্পন্ন খাদ্য ভুল বলে মনে হয় কারণ প্রাথমিক স্তরে এটি ভুল মনে হয়। এটা খাবারের মতই হতে পারে, কিন্তু আমাদের মস্তিষ্ক ভালো জানে। এটা খারাপ হয়েছে, এবং আমরা সেই অনুযায়ী ক্রন্দন করি।