কমন ক্রল 500,000 llms.txt ফাইল পরীক্ষা করে দেখেছে যে 68% একটি প্লাগইন বা টেমপ্লেট থেকে উদ্ভূত হয়েছে, যখন 22% এর কোনো লিঙ্ক নেই।
সিনিয়র রিসার্চ ইঞ্জিনিয়ার মাল্টা ওস্টেনডর্ফের দ্বারা শেয়ার করা বিশ্লেষণে দেখা গেছে যে 6% ফাইলে AI সাইটগুলি ব্যবহার করার নির্দেশাবলী অন্তর্ভুক্ত ছিল, যেমন রেট লিমিট এবং কপিরাইট নোটিশ, যা llms.txt স্ট্যান্ডার্ড কভার করে না। উপরন্তু, কিছু ফাইল নির্দিষ্ট স্ক্যানার দ্বারা নামকরণ করা হয় এবং তাদের অ্যাক্সেসের অনুমতি দেওয়া হয়েছে কিনা, এমন কিছু যা llms.txt নিয়ন্ত্রণ করতে পারে না। 32টি ফাইলের মধ্যে যা কমন ক্রলের নিজস্ব ক্রলারকে বাতিল করতে দেখা গেছে, দলটি 31টি সাইটের মূল্যায়ন করতে পারে এবং কোনোটিই সরাসরি robots.txt দ্বারা ব্লক করা হয়নি।
জুন মাসে, আমি Ahrefs ডেটা কভার করেছি যে দেখায় যে এর ডেটাসেটের 97% llms.txt ফাইলগুলি অনুরোধ গ্রহণ করছে না। এই বিশ্লেষণটি কেউ ফাইল অ্যাক্সেস করেছে কিনা তার উপর দৃষ্টি নিবদ্ধ করে। সাধারণ ক্রল নিবন্ধটি এই ফাইলগুলির বিষয়বস্তু পরীক্ষা করে।
বেশিরভাগ ফাইল টেমপ্লেট থেকে আসে
Wix পর্যালোচনা করা ফাইলগুলির 41% তৈরি করে। কিছু জেনারেটরে টুলটির নামকরণের একটি লাইন এবং একটি সাধারণ বোর্ডের দ্বারা স্বাক্ষরবিহীন ফাইলগুলিকে গোষ্ঠীভুক্ত করা হয়।
মাত্র অর্ধেকের নিচে (49%) সম্পূর্ণ কাঠামো আছে যার দ্বারা বিশ্লেষণ পরীক্ষা করা হয়: H1 শিরোনাম, সারাংশ উদ্ধৃতি, এবং লিঙ্ক বুলেট বিভাগ। 32% প্রতিটি লিঙ্ক বর্ণনা করে একটি সংক্ষিপ্ত নোট যোগ করুন এবং 22.56% এর কোনো লিঙ্ক নেই। স্পেসিফিকেশন শুধুমাত্র H1 প্রয়োজন এবং লিঙ্ক নোট ঐচ্ছিক হিসাবে বিবেচনা করে.
73,000টি ফাইল জুড়ে, অল ইন ওয়ান এসইও কখনই একটি সারাংশ লেখে না তবে 138টি লিঙ্কের মধ্যম থাকে। নিবন্ধটি বলে যে এটি একটি সাইটম্যাপ হিসাবে llms.txt-কে নির্দেশ করে৷ GoDaddy-এর পার্কিং ডোমেন ফাইলগুলি লিঙ্ক ছাড়াই সমস্ত কাঠামোগত পরীক্ষায় উত্তীর্ণ হয়, এবং বিক্রয় পিচ হিসাবে ব্যবহৃত হয়।
কিছু সাইট robots.txt এর মত llms.txt ব্যবহার করে
llms.txt ফরম্যাট হল AI সিস্টেমকে ওয়েবসাইট পৃষ্ঠাগুলির একটি কিউরেটেড তালিকা দেওয়ার প্রস্তাব। প্রতিবেদনটি ব্যাখ্যা করে যে ফাইলটি “কিছুই দেয় না এবং কিছুই ব্লক করে না এবং এটি পড়ার জন্য কোনও ক্রলারের প্রয়োজন হয় না।” ক্রলাররা অ্যাক্সেসের নিয়ম জানার জন্য robots.txt-এ উল্লেখ করে।
কিছু সাইট robots.txt এর সাথে llms.txt মিশ্রিত করতে পারে। বিশ্লেষিত llms.txt ফাইলগুলির বাইরে, কমন ক্রল llms.txt পাথে 136,578টি robots.txt ফাইল খুঁজে পেয়েছে, যা 1,287,207 প্রতিক্রিয়াগুলির প্রায় 10% যা একটি HTTP 200 ফেরত দিয়েছে৷
বিশ্লেষণ করা ফাইলগুলির মধ্যে, 1,570টি একটি নির্দিষ্ট স্ক্যানারকে উদ্ধৃত করেছে, যখন 32টি CCBot অস্বীকার করেছে। Robots.txt ফাইলগুলি সমস্ত 32টি সাইটের জন্য পুনরুদ্ধার করা হয়েছে, এবং 31টি সাইটের মধ্যে একটিও এটি সম্পূর্ণরূপে অবরুদ্ধ CCBot মূল্যায়ন করতে পারেনি৷ পাঁচটি সাইট স্পষ্টভাবে এটির অনুমতি দিয়েছে, 11টি কিছু লেনের অ্যাক্সেস সীমাবদ্ধ করেছে কিন্তু অন্যদের অনুমতি দিয়েছে এবং 15টির কোনো বিধিনিষেধ নেই। একটি সাইট একটি HTTP 429 ত্রুটি ফিরিয়ে দিয়েছে এবং পরিদর্শন করা যায়নি।
নিবন্ধটি এমন একটি সাইটের দিকে নির্দেশ করে যেখানে llms.txt ফাইলে বলা হয়েছে যে CCBot “জুন 2026 অনুযায়ী” ব্লক করা হয়েছে, কিন্তু মজার বিষয় হল, এর robots.txt আসলে ওয়াইল্ডকার্ড নিয়মের অধীনে ক্রলারকে অনুমতি দেয়। পোস্টটি llms.txt কে নীতির বর্ণনার পরিবর্তে একটি নীতির বিবরণ হিসাবে বর্ণনা করে এবং বলে যে এটি বর্ণনা করা robots.txt এর সাথে সিঙ্কের বাইরে।
সাধারণ ক্রল CCBot চালায়, এবং এটি বলে যে robots.txt ফাইলটিকে সম্মান করে৷
দ্রুত ইনজেকশন বিদ্যমান, কিন্তু এটি বিরল হয়েছে
দশটি ফাইল মডেলটিকে লক্ষ্য করে নির্দেশাবলীর জন্য কমন ক্রলের সবচেয়ে কঠোর পরীক্ষায় মিলিত হয়েছে। দলটি একটি ফাইল সহ চারটি বাস্তব কেস খুঁজে পেয়েছে যার সারাংশ মডেলটিকে পূর্ববর্তী নির্দেশাবলী উপেক্ষা করতে এবং একটি দ্বিতীয় ফাইল আনতে বলে। অন্য ছয়টি মিথ্যা ইতিবাচক ছিল, বেশিরভাগ ডকুমেন্টেশন যা তাদের ব্যাখ্যা করার জন্য নিয়ন্ত্রণ টোকেন উদ্ধৃত করে।
লেখকরা স্পষ্ট করেছেন যে অনুসন্ধানটি এমন নয় যে llms.txt তাত্ক্ষণিক ইনজেকশনে পূর্ণ। প্রকৃতপক্ষে সনাক্ত করা সমস্ত ক্ষেত্রেই, লোকেরা একটি বিন্দু তৈরি করার জন্য এটিকে উদ্দেশ্য করে রাখে। উপরন্তু, 3,793টি ফাইল হালকা নির্দেশিকা দেখিয়েছে, যেমন “এই পৃষ্ঠাগুলিতে ফোকাস করুন।”
বিশ্লেষণ কি দেখাতে পারে এবং কী করতে পারে না
নমুনাটি এমন সাইটগুলি থেকে এসেছে যা CCBot সম্প্রতি কোনো সমস্যা ছাড়াই উদ্ধার করেছে। এই সাইটগুলির একটি বড়, এলোমেলো সেট থেকে /llms.txt স্ক্যানের অনুরোধ করা হয়েছে, আরও নির্দিষ্টভাবে নমুনাযুক্ত /llms-full.txt, এবং অন্তর্ভুক্ত সাইটগুলি ইতিমধ্যেই আগের দুটি স্ক্যান থেকে প্রতিটি ফাইল পরিবেশন করার জন্য পরিচিত।
এর মানে হল যে নমুনাটি শুধুমাত্র ক্রলারের অ্যাক্সেসযোগ্য সাইটগুলিতে এলোমেলো, সমগ্র ইন্টারনেট নয়। পোস্টে উল্লেখ করা হয়েছে যে /llms.txt-এর জন্য 11% গ্রহণের হার সরাসরি Ahrefs বা Web Almanac ডেটার সাথে তুলনীয় নয় কারণ জনসংখ্যা ভিন্ন।
এই বিশ্লেষণটি একটি একক স্ক্যানের উপর ভিত্তি করে করা হয়েছে, তাই এটি নির্ধারণ করতে পারে না যে টেমপ্লেট ফাইল, নীতির ভাষা বা বার্তা ইনজেকশন বাড়ছে কিনা। কোনো এআই সিস্টেম এই ফাইলগুলি পড়ছে কিনা তা নিশ্চিত করতে পারে না। পলিসি এবং ইনজেকশনের সংখ্যা কীওয়ার্ড মিলের উপর ভিত্তি করে, যে পোস্টটি অনুপস্থিত হতে পারে বলে স্বীকার করে।
কেন এই গুরুত্বপূর্ণ?
llms.txt-এ লেখা একটি ক্রলার সীমাবদ্ধতা নিজে থেকে কিছুই করে না। কমন ক্রল উল্লেখ করে যে CCBot robots.txt কে সম্মান করে, তাই এই ক্রলারের জন্য, নিয়মটি সেখানে অন্তর্ভুক্ত করা উচিত। এছাড়াও, এর প্রতিটি llms.txt লাইনকে এই নিয়মগুলি মেনে চলতে হবে।
সামনে তাকান
llms.txt v2 আপডেটটি আমি আগস্টে রিপোর্ট করেছি যাতে পৃষ্ঠাগুলির মার্কডাউন সংস্করণগুলি খুঁজে পাওয়া সহজ করার জন্য লিঙ্ক সম্পর্ক চালু করা হয়েছে। যাইহোক, এটি ফাইলটি যা প্রয়োগ করতে পারে তা পরিবর্তন করেনি। যেহেতু প্লাগইন এবং সাইট নির্মাতারা এখন সাধারণ ক্রল খুঁজে পাওয়া ফাইলগুলির প্রায় দুই-তৃতীয়াংশ তৈরি করে, তাই প্রকৃত বিন্যাস কীভাবে ব্যবহার করা হয় তা হাতে লেখার চেয়ে এই সরঞ্জামগুলি কী তৈরি করে তার উপর নির্ভর করে।
বৈশিষ্ট্যযুক্ত চিত্র: আলফি/শাটারস্টকের কাস্ট