OpenBMB MiniCPM5-2B প্রকাশ করেছে, MiniCPM5 সিরিজের দ্বিতীয় চেকপয়েন্ট এবং MiniCPM5-1B-এর ফলো-আপ। এটি 2,516,756,480 প্যারামিটার সহ একটি ঘন কার্যকারণ ভাষার মডেল, যার মধ্যে 1,981,982,720টি এম্বেডিংয়ের বাইরে বসে। এটি 42টি স্তর ব্যবহার করে, 16টি ক্যোয়ারী হেড এবং 2টি কী/মান হেড সহ ক্লাস্টারড কোয়েরির প্রতি মনোযোগ এবং 131,072 টোকেনের একটি নেটিভ প্রসঙ্গ উইন্ডো। স্থাপত্য আদর্শ LlamaForCausalLMতাই মূলধারার ইঞ্জিনগুলো কোনো কাস্টম কার্নেল এবং কোনো মডেল কোড ফর্ক ছাড়াই এটি লোড করে।
এটা কি স্থাপনযোগ্য? হ্যাঁ ওজন হল Apache 2.0 এবং vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX এবং FlagOS এর মাধ্যমে চলে।
সূচক টেবিল আসলে কি দেখায়
OpenBMB MiniCPM5-2B-কে LFM2.5-2.6B, Qwen3.5-2B এবং Gemma-4-E2B-এর সাথে একই আকারের শ্রেণীতে তুলনা করে এবং Qwen3.5-4B, গ্রানাইট-4.2-3B, নেমোটোরন-3-Nano-4B, Gemma-3-Nano-4B, LBB4-4-B- এবং LFM2-4-এ তালিকাভুক্ত করে। 34টিরও বেশি বেঞ্চমার্ক লাইনে এটি দাঁড়ায় 53.9 এর গড়। এই সেটের সেরা বেসলাইন হল 51.1-এ Qwen3.5-4B, 42.7-এ গ্রানাইট-4.2-3B এবং 33.2-এ LFM2.5-2.6B৷
কোড যুক্তিতে, MiniCPM5-2B LiveCodeBench v6 বনাম 56.4-এ 69.1 এবং SWE-বেঞ্চ ভেরিফায়েড বনাম 33.6-এ 46.4 পোস্ট করে। টুল ব্যবহারের বিস্তৃত মার্জিন রয়েছে: τ²-বেঞ্চ টেলিকমে 97.1, BFCL v4-এ 66.6 এবং τ³-বেঞ্চ ব্যাঙ্কিং বনাম 6.8-এ 20.8। দীর্ঘ প্রসঙ্গ বিভক্ত করা হয়েছে, NoLiMa বনাম 43.5-এ 68.1, কিন্তু AA-LCR বনাম 61.0-এ 59.0 এবং LongBench v2 বনাম 47.3-এ 43.7। সাধারণ জ্ঞান যেখানে আকারের ব্যবধান দেখায়: MMLU-Pro বনাম 78.0-এ 70.8, এবং Humanity-এর সাম্প্রতিক পরীক্ষায় 9.9 বনাম 8.9৷ OpenBMB কৃত্রিম বিশ্লেষণ থেকে প্রাপ্ত সারিগুলিকে অভ্যন্তরীণভাবে পুনর্গঠিত করা থেকে আলাদাভাবে চিহ্নিত করে।
টিউটোরিয়াল রেসিপি: SFT, তারপর RL, তারপর নীতি পাতন
টিউটোরিয়ালটি মূল গবেষণায় বর্ণিত আল্ট্রাডেটার স্তরযুক্ত ডেটা ব্যবস্থাপনা পদ্ধতি অনুসরণ করে। বেসলাইন প্রশিক্ষণ স্থিতিশীলতা এবং ক্ষয় পর্যায়গুলি সক্রিয় করে এবং তারপরে মধ্য-প্রশিক্ষণ মডেলটিকে লক্ষ্য ডেটা বিতরণে সামঞ্জস্য করে। প্রশিক্ষণ শুরু হওয়ার পর SFT গভীর চিন্তার 400B টোকেন দিয়ে, এবং তারপর অডিটর-ভিত্তিক JustRL II অ্যালগরিদম ব্যবহার করে গণিত, কোড, এজেন্ট কাজ এবং লেখার জন্য বিশেষ RL শিক্ষকদের প্রশিক্ষণ দেয়।
শেষ ধাপ হল নীতি দ্বারা পরিমার্জন। OPD 16 RL বিশেষজ্ঞ, তাদের মধ্যে পাঁচজন এজেন্টকে একক প্রেরণ মডেলে একীভূত করে। প্রতিটি প্রতিক্রিয়া অবস্থানে এটি বৈধতা-ভিত্তিক সুবিধা প্রতিস্থাপন করে, সুবিধার অনুমান হিসাবে ছাত্র এবং শিক্ষক লগিটগুলির মধ্যে সম্পূর্ণ শব্দভান্ডারের বিপরীত KL বিচ্যুতি গণনা করে। এটি RL নির্দেশাবলীকে পরিমার্জন ডেটা হিসাবে পুনরায় ব্যবহার করে, তাই কোন নতুন কর্পাস তৈরি করা হয় না। ওপেনবিএমবি যুক্তি ও সাধারণ মানদণ্ডে RL প্লাস ওপিডি পর্যায়ে গড়ে 10.96 পয়েন্ট এবং বেঞ্চমার্কে 6.96 পয়েন্ট করে।
ডাটাও খোলা আছে
ওজনের পাশাপাশি, OpenBMB আল্ট্রা-ফাইনওয়েব, আল্ট্রা-ফাইনওয়েব-এল3, আল্ট্রাএক্স, আল্ট্রাডেটা-কোড, আল্ট্রাডেটা-ম্যাথ, আল্ট্রাডেটা-এসএফটি-2605, আল্ট্রাডেটা-এসএফটি-এজেন্ট-2609 500K এজেন্টের নমুনা সহ, এবং আল্ট্রাডেটা-908-এর চেয়ে বেশি নমুনা প্রকাশ করেছে। ইন্টারমিডিয়েট পয়েন্টগুলিও প্রকাশিত হয়েছে, শুধুমাত্র বেস, মিডট্রেন এবং এসএফটি কভার করে, যাতে প্রতিটি পর্যায়ের অবদান সরাসরি পরিমাপ করা যায়।
সারাংশ
MiniCPM5-2B এজেন্ট কাজের চাপ এবং টুল কলের জন্য একটি নির্ভরযোগ্য ডিভাইস বিকল্প, সাধারণ জ্ঞানের মডেল নয়। NoLiMa-স্টাইলের লং-কনটেক্সট টুলস, এনকোডিং এজেন্ট এবং পুনরুদ্ধার ব্যবহার করার সময় এর সুবিধাটি সবচেয়ে স্পষ্ট, এবং এটি MMLU-Pro, GPQA-ডায়মন্ড এবং MATH-500-এ বড় মডেলগুলিকে অনুসরণ করে। উন্মুক্ত ডেটা এবং মধ্যবর্তী পয়েন্টগুলি RL প্লাস OPD দাবিকে পরীক্ষাযোগ্য করে তোলে, যা শিরোনাম গড় থেকে বেশি গুরুত্বপূর্ণ।
একটি মূল গ্রহণ
- ঘন মডেল 2.52B, 131,072 টোকেনের প্রসঙ্গ, Apache 2.0, স্ট্যান্ডার্ড লামা আর্কিটেকচার।
- 34 মেট্রিক্স জুড়ে গড় 53.9, Qwen3.5-4B থেকে 51.1-এ এগিয়ে।
- সরঞ্জাম, দীর্ঘ প্রসঙ্গ এনকোডিং এবং পুনরুদ্ধার এজেন্ট ব্যবহারে সবচেয়ে শক্তিশালী; জ্ঞানে সবচেয়ে দুর্বল।
- RL শিক্ষকদের সাথে একজোড়া SFT 400B টোকেন প্রশিক্ষণের পর এবং নীতি অনুযায়ী পরিমার্জন।
- প্রি-ওয়ার্কআউট, এসএফটি এবং আরএল ডেটাসেট ওজনের পাশাপাশি পাঠানো হয়।
চেক আউট এইচএফ, GitHub রেপো এবং ইন্টারনেট. এছাড়াও, নির্দ্বিধায় আমাদের অনুসরণ করুন কিচিরমিচির এবং আমাদের সাথে যোগ দিতে ভুলবেন না 150k+ ML SubReddit এবং সাইন আপ করুন আমাদের নিউজলেটার. অপেক্ষা করুন! আপনি কি টেলিগ্রামে আছেন? এখন আপনি টেলিগ্রামে আমাদের সাথে যোগ দিতে পারেন।
আপনার GitHub রেপো বা আলিঙ্গন হোমপেজ বা পণ্য প্রকাশ বা ওয়েবিনার, ইত্যাদি প্রচার করতে আমাদের সাথে অংশীদারি করতে হবে? আমাদের সাথে সংযোগ করুন
সানা হাসান, মার্কটেকপোস্টের একজন পরামর্শক ইন্টার্ন এবং আইআইটি মাদ্রাজের দ্বৈত ডিগ্রির ছাত্র, বাস্তব বিশ্বের চ্যালেঞ্জ মোকাবেলায় প্রযুক্তি এবং কৃত্রিম বুদ্ধিমত্তা প্রয়োগ করার বিষয়ে উত্সাহী। ব্যবহারিক সমস্যা সমাধানে গভীর আগ্রহের সাথে, তিনি AI এবং বাস্তব-জীবনের সমাধানগুলির সংযোগস্থলে একটি নতুন দৃষ্টিভঙ্গি নিয়ে আসেন।