یادداشت انتشار مدل GLM-5.3 شرکت زhipu حاوی جملهای است که در بیشتر گزارشهای رسانهای مورد توجه قرار نگرفته است. این شرکت مستقر در پکن، هنگام توصیف نتایج مربوط به امنیت سایبری، تصریح کرده که این قابلیت «دقیقاً جایی که بیشترین فاصله را داریم، سریعترین رشد را دارد».
زhipu که با نام Z.ai نیز شناخته میشود، یکی از معدود آزمایشگاههای چینی است که مدلهایی در سطح رقابت با مرزهای فناوری آمریکایی منتشر میکند. در چهاردهم اوت، این شرکت GLM-5.3 را به عنوان مدلی متمرکز بر کدنویسی عرضه کرد و یادداشت فنی منتشر نمود که عملکرد مدل را در مقایسه با رقبا مشخص میسازد. این یادداشت منبع تمام اطلاعات گزارششده در اینجا محسوب میشود.
ادعایی که بیشترین توجه را به خود جلب کرد، مربوط به حوزه امنیت بود. زhipu اعلام کرد GLM-5.3 به طور غیرمنتظرهای در یافتن آسیبپذیریهای نرمافزاری موفق عمل کرده و در بنچمارک CyberGym امتیاز ۸۴.۵ درصد کسب کرده است، در حالی که Mythos 5 آنتروپیک ۸۳.۸ درصد و GPT-5.6 Sol اوپنایآی ۸۳.۶ درصد داشتهاند. پس از آن تیترهایی مبنی بر پیشی گرفتن مدل چینی از مدلهای آمریکایی در شکار باگ منتشر شد.
دلیل اهمیت این موضوع فراتر از یک نتیجه بنچمارک معمولی، به ماهیت کشف آسیبپذیری بازمیگردد. مدلی که بتواند کدبیس را بخواند و نقصهای قابل بهرهبرداری را شناسایی کند، هم برای مدافعان در حسابرسی نرمافزار و هم برای مهاجمان مفید است. کار مشابه آنتروپیک پشت دسترسی محدود قرار دارد، در حالی که زhipu قصد دارد وزنهای GLM-5.3 را برای دانلود عمومی منتشر کند.
انتشار خود زhipu محتاطانهتر از پوشش رسانهای آن است. عدد CyberGym واقعی و موجود در مقاله است، اما این باریکترین نتیجه از سه نتیجه امنیت سایبری منتشرشده توسط شرکت است و زhipu صراحتاً اعلام کرده که دو نتیجه دیگر به نفع رقبا هستند.
سه بنچمارک، سه تصویر متفاوت
CyberGym از کد منبع قابل خواندن توسط مدل شروع میشود و بررسی میکند آیا مدل میتواند آسیبپذیری را پیدا کرده و صحت آن را تأیید کند. این نتیجهای است که منتشر شد و حاشیه آن هفتدهم درصد است.
ExploitBench وظیفه سختتری میخواهد و مدل را ملزم به استدلال درباره آسیبپذیری واقعی و نحوه بهرهبرداری از آن میکند. GLM-5.3 امتیاز ۵۴.۴ درصد کسب کرده که بیش از دو برابر امتیاز ۲۴.۴ درصدی نسخه قبلی آن است. Mythos 5 امتیاز ۷۸.۰ درصد و GPT-5.6 Sol امتیاز ۷۶.۵ درصد دارد.
ExploitGym تعداد وظایف بهرهبرداری را که مدل در بودجه زمانی ثابت تکمیل میکند، میشمارد. GLM-5.3 در دو ساعت ۱۰۵ وظیفه و در شش ساعت ۱۳۰ وظیفه را تکمیل کرده، در حالی که Mythos 5 به ترتیب ۱۸۱ و ۲۴۷ وظیفه را انجام داده است.
این دو نتیجه کمتر گزارش شدهاند و همانهایی هستند که شکاف را توصیف میکنند. یافتن نقص و ساخت اکسپلویت عملی از آن، کارهای متفاوتی هستند. خوانش زhipu این است که هرچه آزمون در زنجیره جلوتر باشد، مدل عقبتر است و شرکت این موضوع را در انتشار خود بیان کرده است.
کدام مدل آنتروپیک و دلیل تغییر مداوم
بخشی از سردرگمی پوشش رسانهای از مقایسه سه مدل متفاوت آنتروپیک در سه بخش متفاوت ناشی میشود. جدول بنچمارک اصلی GLM-5.3 را با Opus 4.8 مقایسه میکند، نمودارهای عملکرد از Fable 5 استفاده میکنند و بخش امنیت سایبری از Mythos 5 بهره میبرد. خواننده سریع به مقایسهای واحد میرسد که وجود ندارد.
در زمینه کدنویسی، تصویر مختلط است نه غالب. GLM-5.3 در برخی آزمونها از Opus 4.8 پیشی میگیرد و در برخی عقب میماند و زhipu صراحتاً اعلام کرده که مدلش در بنچمارک داخلی کدنویسی شرکت، پشت Claude Fable 5 قرار دارد.
نحوه اجرای آزمونها
پانویسهای روششناسی حاوی نکتهای است که خلاصهها از آن صرفنظر کردهاند. زhipu GLM-5.3 را روی CyberGym، ExploitGym، ExploitBench، Terminal Bench و چندین وظیفه دیگر داخل Claude Code 2.1.207، عامل کدنویسی آنتروپیک، ارزیابی کرده است.
این کار نامناسب نیست. استفاده از harness مشترک میان مدلها روشی برای حفظ انصاف مقایسه است و زhipu تنظیمات مورد استفاده را مستند کرده است. با این حال، شایان توجه است که ادعاهای مرزی یک مدل وزنباز چینی از طریق نرمافزار عامل آمریکایی اندازهگیری میشود.
دو جزئیات دیگر پیش از تلقی نتیجه CyberGym به عنوان قطعی، شایسته توجه هستند. امتیاز یک اجرای واحد است که به صورت pass@1 روی ۱۵۰۷ وظیفه گزارش شده و هیچ رقم واریانسی ارائه نشده است. فاصله هفتدهم امتیازی بین دو اجرای واحد، فاصلهای نیست که بتوان بر آن تکیه کرد. همچنین بودجههای زمانی ExploitGym با نرخهای throughput از Artificial Analysis نرمالسازی شدهاند.
تعداد آسیبپذیریها و عددی که غایب است
فراتر از بنچمارکها، زhipu اعلام کرده که با تیمهای امنیتی چین همکاری کرده و مدلهای خود را روی کدبیسهای واقعی اجرا کرده و ۲۴۳۶ آسیبپذیری را در ۲۶۹ پروژه متنباز شناسایی کرده است. توزیع شدت شامل ۱۰۷ بحرانی، ۹۹۰ بالا، ۱۲۸۶ متوسط و ۵۳ پایین است. قدیمیترین نقص به سال ۱۹۸۱ بازمیگردد و میانگین آسیبپذیری ۲۶.۶ سال در کد باقی مانده بود.
یک ناهماهنگی شایسته دقت است. پنل خلاصه زhipu ۱۰۹۷ یافته را بحرانی و بالا برچسب زده که با جدول شدت مطابقت دارد، اما متن بدنه همان انتشار این ۱۰۹۷ را متوسط تا بالا توصیف کرده است.
تعداد پس از بررسی کارشناسی، غربالگری و حذف تکرار گزارش شده، بنابراین خروجی خام مدل نیست. از ۲۴۳۶ یافته، ۵۳ مورد به صورت عمومی افشا شده و ۲۳۸۳ مورد همچنان تحت embargo هستند. انتشار نمیگوید چند مورد قبلاً ناشناخته بودهاند و چند مورد به طور مستقل بازتولید شدهاند.
آنچه مهمتر از جدول بنچمارک است
دو نکته در انتشار، پیامدهای بلندمدتتری نسبت به حاشیه CyberGym دارند.
نخست کارایی است. زhipu گزارش میدهد GLM-5.3 در بنچمارک داخلی کدنویسی به ۳۱.۴ درصد با حدود ۵۰٬۰۰۰ توکن خروجی per task رسیده، در حالی که Opus 4.8 با ۱۲۰٬۰۰۰ توکن به ۲۹.۵ درصد دست یافته است. عملکرد اندکی بهتر با کمتر از نیمی از توکنها، استدلال هزینهای ایجاد میکند.
دوم توزیع است. زhipu اعلام کرده وزنها پس از تکمیل ارزیابی و hardening ایمنی منتشر خواهند شد. این کار هنوز انجام نشده و تا آن زمان، ادعای وزنباز یک تعهد است نه واقعیت. در صورت تحقق، مدلی با قابلیت مستند کشف آسیبپذیری در دسترس هر تیمی قرار میگیرد.
وزنها تا پایان اوت منتشر خواهند شد.


نظرات
ثبت نظر جدید
هنوز نظری ثبت نشده است. اولین نفر باشید!