100,000 চাইনিজ চিপসের উপর ভিত্তি করে Z.ai প্রাইভেট GLM-5.3-ফ্ল্যাশ ইনফারেন্স



100,000 চাইনিজ চিপসের উপর ভিত্তি করে Z.ai প্রাইভেট GLM-5.3-ফ্ল্যাশ ইনফারেন্স

Z.ai 17 সেপ্টেম্বর, 2026-এ একটি প্রযুক্তিগত অ্যাকাউন্ট প্রকাশ করে যা বর্ণনা করে যে কীভাবে এটি তার GLM-5.3-ফ্ল্যাশ মডেলের জন্য 100,000টিরও বেশি চীনা তৈরি AI এক্সিলারেটরের একটি ক্লাস্টারে স্ক্র্যাচ থেকে একটি সম্পূর্ণ প্রোডাকশন-গ্রেড ইনফারেন্স পরিষেবা তৈরি করেছে। কোম্পানির মতে, কাজের একটি উল্লেখযোগ্য অংশ GLM-5.3 দ্বারা চালিত একটি ইনফ্রা এজেন্ট দ্বারা সঞ্চালিত হয়েছিল এবং শুধুমাত্র পরিকাঠামো প্রকৌশলীদের দ্বারা নয়, এবং GLM-5.3-ফ্ল্যাশের জন্য সমস্ত উত্পাদন সিদ্ধান্ত সিস্টেমে চলে।

Z.ai বলেন, এর আগে কেউ এই ধরনের স্কেলে চীনের তৈরি এক্সিলারেটরের ক্লাস্টার পরিচালনা করেনি। কোম্পানী তুলনামূলকভাবে সীমিত অন-চিপ মেমরি ক্ষমতা এবং ব্যান্ডউইথ, একটি নতুন মডেল আর্কিটেকচার, একটি 1M-টোকেন প্রসঙ্গ উইন্ডো এবং মাল্টিমোডাল অনুরোধ উল্লেখ করেছে, যেখানে একটি অপরিপক্ক ইকোসিস্টেমের পাশাপাশি মূল সমর্থন অসম্পূর্ণ ছিল এবং প্রকৌশলীদের এমন আচরণ অনুমান করতে হয়েছিল যা নথিভুক্ত করা উচিত ছিল।

GLM-5.3-ফ্ল্যাশ 26শে আগস্ট, 2026-এ GLM-5 সিরিজের প্রথম মূল মাল্টিমোডাল মডেল হিসাবে চালু করা হয়েছিল, 320 বিলিয়ন মোট প্যারামিটার এবং 18 বিলিয়ন সক্রিয় প্যারামিটার একটি হাইব্রিড আর্কিটেকচারের অধীনে স্পার্স এবং লিনিয়ার মনোযোগের সমন্বয়ে। প্রকাশের আগে, Z.ai বেনামে মডেলটিকে OpenCode এবং OpenRouter-এ অক্স-আলফা হিসাবে পরীক্ষা করেছিল এবং কোম্পানি বলেছিল যে এটি লঞ্চের এক সপ্তাহের মধ্যে উভয় প্ল্যাটফর্মে সর্বাধিক জনপ্রিয় মডেল হয়ে উঠেছে, ছয় দিনে 62 ট্রিলিয়ন টোকেন প্রক্রিয়াকরণ করেছে।

ঘন প্রতিক্রিয়া পদ্ধতি

অ্যাকাউন্টের কেন্দ্রে একটি সিস্টেমিক সমস্যা রয়েছে: এন্ড-টু-এন্ড মেট্রিক্স একজন এজেন্টকে বলতে পারে যে ফলাফল খারাপ হয়েছে, কিন্তু কেন নয়। একটি ব্যর্থ সাংখ্যিক নির্ভুলতা পরীক্ষা, টাইম-টু-টোকেনে 30% বৃদ্ধি, বা আউটপুট থ্রুপুটে 20% হ্রাস নির্দেশ করে না কোন স্তরটি দায়ী বা পরবর্তীতে কী পরীক্ষা করতে হবে। Z.ai এর উত্তর, যাকে এটি ঘন প্রতিক্রিয়া বলে, সঠিকতা পরীক্ষা, রানটাইম লগ, এক্সিকিউশন ট্রেস, রানটাইম ইভেন্ট, মাইক্রো-বেঞ্চমার্ক এবং এন্ড-টু-এন্ড মেট্রিক্সকে পুনরাবৃত্তিযোগ্য ওয়ার্কফ্লোতে ভাঁজ করে যা এজেন্টকে প্রতিটি পরিবর্তনের পরে সম্পূর্ণ স্থাপনা এবং লোড পরীক্ষার জন্য অপেক্ষা করার পরিবর্তে স্থানীয়ভাবে প্রতিটি হাইপোথিসিস যাচাই করতে দেয়।

কোম্পানি এই ধরনের প্রতিক্রিয়ার জন্য তিনটি প্রয়োজনীয় বৈশিষ্ট্য সংজ্ঞায়িত করে। এটি অবশ্যই স্থানীয় হতে হবে, যেখানেই সম্ভব নির্দিষ্ট লঞ্চ প্যারামিটার, কোড পরিবর্তন, কার্নেল, ইনপুট শর্ত, থ্রেড, এক্সিকিউশন ইন্টারভাল বা কোড পাথের সাথে বাঁধা। এটি অর্জন করতে সস্তা এবং সময়োপযোগী হতে হবে। এবং এটি অবশ্যই রেফারেন্স অ্যাপ্লিকেশন এবং নিয়ন্ত্রিত পরীক্ষা-নিরীক্ষার মাধ্যমে উদ্দেশ্যমূলক বৈধতাকে সমর্থন করবে, কারণ নিজেদের দ্বারা পর্যবেক্ষিত পারস্পরিক সম্পর্ক মূল কারণ স্থাপন করে না।

অ্যাকাউন্টে বর্ণনা করা লঞ্চ লুপে, প্রকৌশলীরা লক্ষ্য এবং সিস্টেমের সীমানা সংজ্ঞায়িত করেছেন এবং সংখ্যাসূচক শব্দার্থবিদ্যা, সঙ্গতি এবং উত্পাদন ঝুঁকি সহ সমালোচনামূলক পরিবর্তনগুলি পর্যালোচনা করেছেন, যখন এজেন্ট বিশ্লেষণ, অনুমান এবং কোড পরিবর্তনগুলি পরিচালনা করে। রৈখিক মনোযোগ এবং LM হেড, রিপ্লেএসএসএম, W8A8 কোয়ান্টাইজেশন, মিশ্র-নির্ভুলতা INT8/FP8/BF16 ক্যাশে কোয়ান্টাইজেশন, এবং স্তর বিভাজন, একটি পচনশীল এনকোড-প্রি-কোডচার-ডিডি-এর অধীনে সমন্বিত ইন্ট্রা-নোড টেনসর সমান্তরালতাকে তারা সহ-অপ্টিমাইজ করেছে।

তিনটি ইঞ্জিনিয়ারিং কেস

প্রথম ক্ষেত্রে সংখ্যাগত সঠিকতা উদ্বেগ. বিভাজিত এবং অ-বিভাজনকৃত কার্নেল এক্সিকিউশন পাথগুলির মধ্যে একটি তুলনা যাচাই KDA কার্নেলের প্রসঙ্গ সমান্তরাল পথে একটি নির্ভুলতার সমস্যা প্রকাশ করেছে: tl.dot অপারেশনটি একটি TF32 গণনাতে ডিফল্ট হয়েছিল এমনকি যখন এটির ইনপুট FP32 ছিল, তাই রাজ্যের একত্রিতকরণের সময় দৈর্ঘ্য বৃদ্ধির সময় ত্রুটিগুলি জমেছে। প্যাচটি স্পষ্টভাবে tf32x3 তে ইনপুট নির্ভুলতা সেট করে, যা একটি উচ্চ নির্ভুলতা ফলাফল তৈরি করতে তিনটি TF32 টেনসর কোর অপারেশন ব্যবহার করে।

অ্যাকাউন্ট অনুসারে, সংশোধনগুলি আপস্ট্রিম ফ্ল্যাশ লিনিয়ার অ্যাটেনশনে একত্রিত করা হয়েছিল। পুল অনুরোধ, 27 আগস্ট, 2026-এ খোলা এবং একত্রিত করা, স্টেট আপডেটে tf32x3 affine চেইন প্রয়োগ করে এবং মার্জ কার্নেলকে জয়েন প্রিসিশন পাথ হিসাবে রূপান্তরিত করে, প্রসঙ্গ সমান্তরাল পরীক্ষা যোগ করে এবং স্পষ্টভাবে tf32, NPU, NVID সমর্থন ছাড়াই প্ল্যাটফর্মে নির্ভুলতায় ফিরে আসে। 8.0)।

দ্বিতীয় ক্ষেত্রে একই সময়ে কেভি ট্রান্সফারের বাধার বিষয়ে উদ্বেগ প্রকাশ করে। গণনা অনুসারে, প্রকৌশলীরা একটি গ্রহণযোগ্যতা মাপকাঠি স্থাপন করেছেন যার মাধ্যমে, একই কাজের চাপের অধীনে, প্রিফিল প্লাস কেভি ট্রান্সফার একা প্রিফিলের বেসলাইনের 5% এর মধ্যে কাজ করা উচিত। এজেন্ট কিছু পরিস্থিতিতে 20% এর বেশি ফাঁক খুঁজে পেয়েছে এবং সেগুলিকে ডিপইপি v1.2.1-তে চিহ্নিত করেছে, যেখানে ইন্ট্রানোড নয়ডিসপ্যাচ বা ইন্ট্রা-নোডকম্বাইন কলটি স্পষ্টভাবে পাইথন জিআইএল প্রকাশ করেছে। যতক্ষণ এই কলগুলি লক আটকে রেখেছিল, একই প্রক্রিয়ায় মুনকেক ট্রান্সফার পাইথন থ্রেড সময়মতো জিআইএল অর্জন করতে ব্যর্থ হয়েছিল, তাই স্থানান্তর কাজগুলির সময় এবং জমা দেওয়া গণনাকে স্খলিত করে এবং ওভারল্যাপ করে। অ্যাকাউন্টটি নোট করে যে সেই সংস্করণে ইন্টারনোড_ডিসপ্যাচ ইতিমধ্যেই জিআইএলকে মুক্ত করেছে, একটি কোড মন্তব্যের সাথে উল্লেখ করা হয়েছে যে সিপিইউ অপেক্ষা করার সময় অন্যান্য থ্রেডগুলিতে কেভি ট্রান্সফার ব্লক করা এড়ানোর উদ্দেশ্য ছিল। প্রাসঙ্গিক C++ সম্পাদনের ব্যবধানে প্যাচ GIL প্রকাশ করার পরে, অ্যাকাউন্ট রিপোর্ট করে, একই পরীক্ষার শর্তে ব্যবধান 1% এর নিচে নেমে গেছে।

তৃতীয় ক্ষেত্রে মূল কর্মক্ষমতা উদ্বেগ. Z.ai-এর কাছে SGLang, Flash Linear Attention, এবং DeepGEMM সহ প্রজেক্টগুলিতে হস্তলিখিত কার্নেলগুলি থেকে প্রযোজ্য শর্ত, রূপান্তর পদ্ধতি, সম্পদের সীমাবদ্ধতা এবং বৈধতা প্রমাণ সহ পুনঃব্যবহারযোগ্য অপ্টিমাইজেশন কঙ্কালে কৌশলগুলি পাতন করার এজেন্ট ছিল৷ কেডিএ ডিকোডের একটি প্রতিনিধি কার্নেলে, কোম্পানি রিপোর্ট করে যে এজেন্ট ডিভিশন অপ্টিমাইজেশান এক্সিকিউশন টাইম 9.6% কমিয়েছে। ফিডব্যাক গণনাটিকে প্রধান বাধা হিসাবে চিহ্নিত করার পরে, এজেন্ট কার্নেলের ভি-ডাইমেনশন টাইলগুলিকে একত্রিত করেছে, যা একই FP32 স্বাভাবিককরণ এবং গেটিং গণনাগুলিকে চারবার পুনরাবৃত্তি করেছে, একটি একক-থ্রেডেড ব্লকে রেজিস্ট্রার-রেসিডেন্ট ইন্টারমিডিয়েট ফলাফল এবং বিকৃতি স্তরে একক হ্রাস, যা কোম্পানির পূর্ববর্তী সংস্করণ 1×7 এর বেশি হিসাবে রিপোর্ট করেছে।

ঘোষিত ফলাফল এবং পুনরাবৃত্ত স্ব-উন্নতি

Z.ai রিপোর্ট করে যে GLM-5.3-ফ্ল্যাশ প্রাথমিক প্রোটোটাইপ ফিট থেকে উৎপাদন প্রস্তুতিতে দুই সপ্তাহেরও কম সময়ের মধ্যে চলে গেছে, শেষ থেকে শেষ পর্যন্ত থ্রুপুট প্রাথমিক বেসলাইনের চেয়ে তিনগুণ বেড়েছে। কোম্পানি আরও বলেছে যে হার্ডওয়্যার ব্যবহারের দক্ষতা এবং প্রতি টোকেন খরচ মূলধারার NVIDIA প্রসেসরের সাথে তুলনীয় পর্যায়ে পৌঁছেছে।

কোম্পানী প্রচেষ্টাটিকে পুনরাবৃত্ত স্ব-উন্নতির একটি প্রাথমিক উদাহরণ হিসাবে তৈরি করে এবং নোট করে যে মডেলটি যে অনুমান পদ্ধতির উপর কাজ করে তার অপ্টিমাইজেশানে অংশগ্রহণ করেছিল। একই সময়ে, Z.ai বলে যে এটি এখনও পুনরাবৃত্ত স্ব-উন্নতিতে পৌঁছায়নি, এবং লক্ষ্য নির্বাচন করা, সীমা নির্ধারণ করা এবং ঝুঁকি মূল্যায়ন করা মানুষের দায়িত্ব থেকে যায় যা এটি বিশ্বাস করে যে মানুষের ধরে রাখা উচিত।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *