B o t I r a n

تحلیل نتایج GLM-5.3 زhipu فراتر از اعداد بنچمارک

تحلیل نتایج GLM-5.3 زhipu فراتر از اعداد بنچمارک

یادداشت انتشار GLM-5.3 زhipu جمله‌ای کلیدی دارد که اغلب نادیده مانده و نشان می‌دهد قابلیت امنیت سایبری مدل دقیقاً در جایی رشد می‌کند که بیشترین فاصله را با رقبا دارد.

یادداشت انتشار مدل GLM-5.3 شرکت زhipu حاوی جمله‌ای است که در بیشتر گزارش‌های رسانه‌ای مورد توجه قرار نگرفته است. این شرکت مستقر در پکن، هنگام توصیف نتایج مربوط به امنیت سایبری، تصریح کرده که این قابلیت «دقیقاً جایی که بیشترین فاصله را داریم، سریع‌ترین رشد را دارد».

زhipu که با نام Z.ai نیز شناخته می‌شود، یکی از معدود آزمایشگاه‌های چینی است که مدل‌هایی در سطح رقابت با مرزهای فناوری آمریکایی منتشر می‌کند. در چهاردهم اوت، این شرکت GLM-5.3 را به عنوان مدلی متمرکز بر کدنویسی عرضه کرد و یادداشت فنی منتشر نمود که عملکرد مدل را در مقایسه با رقبا مشخص می‌سازد. این یادداشت منبع تمام اطلاعات گزارش‌شده در اینجا محسوب می‌شود.

ادعایی که بیشترین توجه را به خود جلب کرد، مربوط به حوزه امنیت بود. زhipu اعلام کرد GLM-5.3 به طور غیرمنتظره‌ای در یافتن آسیب‌پذیری‌های نرم‌افزاری موفق عمل کرده و در بنچمارک CyberGym امتیاز ۸۴.۵ درصد کسب کرده است، در حالی که Mythos 5 آنتروپیک ۸۳.۸ درصد و GPT-5.6 Sol اوپن‌ای‌آی ۸۳.۶ درصد داشته‌اند. پس از آن تیترهایی مبنی بر پیشی گرفتن مدل چینی از مدل‌های آمریکایی در شکار باگ منتشر شد.

دلیل اهمیت این موضوع فراتر از یک نتیجه بنچمارک معمولی، به ماهیت کشف آسیب‌پذیری بازمی‌گردد. مدلی که بتواند کدبیس را بخواند و نقص‌های قابل بهره‌برداری را شناسایی کند، هم برای مدافعان در حسابرسی نرم‌افزار و هم برای مهاجمان مفید است. کار مشابه آنتروپیک پشت دسترسی محدود قرار دارد، در حالی که زhipu قصد دارد وزن‌های GLM-5.3 را برای دانلود عمومی منتشر کند.

انتشار خود زhipu محتاطانه‌تر از پوشش رسانه‌ای آن است. عدد CyberGym واقعی و موجود در مقاله است، اما این باریک‌ترین نتیجه از سه نتیجه امنیت سایبری منتشرشده توسط شرکت است و زhipu صراحتاً اعلام کرده که دو نتیجه دیگر به نفع رقبا هستند.

سه بنچمارک، سه تصویر متفاوت

CyberGym از کد منبع قابل خواندن توسط مدل شروع می‌شود و بررسی می‌کند آیا مدل می‌تواند آسیب‌پذیری را پیدا کرده و صحت آن را تأیید کند. این نتیجه‌ای است که منتشر شد و حاشیه آن هفت‌دهم درصد است.

ExploitBench وظیفه سخت‌تری می‌خواهد و مدل را ملزم به استدلال درباره آسیب‌پذیری واقعی و نحوه بهره‌برداری از آن می‌کند. GLM-5.3 امتیاز ۵۴.۴ درصد کسب کرده که بیش از دو برابر امتیاز ۲۴.۴ درصدی نسخه قبلی آن است. Mythos 5 امتیاز ۷۸.۰ درصد و GPT-5.6 Sol امتیاز ۷۶.۵ درصد دارد.

ExploitGym تعداد وظایف بهره‌برداری را که مدل در بودجه زمانی ثابت تکمیل می‌کند، می‌شمارد. GLM-5.3 در دو ساعت ۱۰۵ وظیفه و در شش ساعت ۱۳۰ وظیفه را تکمیل کرده، در حالی که Mythos 5 به ترتیب ۱۸۱ و ۲۴۷ وظیفه را انجام داده است.

این دو نتیجه کمتر گزارش شده‌اند و همان‌هایی هستند که شکاف را توصیف می‌کنند. یافتن نقص و ساخت اکسپلویت عملی از آن، کارهای متفاوتی هستند. خوانش زhipu این است که هرچه آزمون در زنجیره جلوتر باشد، مدل عقب‌تر است و شرکت این موضوع را در انتشار خود بیان کرده است.

کدام مدل آنتروپیک و دلیل تغییر مداوم

بخشی از سردرگمی پوشش رسانه‌ای از مقایسه سه مدل متفاوت آنتروپیک در سه بخش متفاوت ناشی می‌شود. جدول بنچمارک اصلی GLM-5.3 را با Opus 4.8 مقایسه می‌کند، نمودارهای عملکرد از Fable 5 استفاده می‌کنند و بخش امنیت سایبری از Mythos 5 بهره می‌برد. خواننده سریع به مقایسه‌ای واحد می‌رسد که وجود ندارد.

در زمینه کدنویسی، تصویر مختلط است نه غالب. GLM-5.3 در برخی آزمون‌ها از Opus 4.8 پیشی می‌گیرد و در برخی عقب می‌ماند و زhipu صراحتاً اعلام کرده که مدلش در بنچمارک داخلی کدنویسی شرکت، پشت Claude Fable 5 قرار دارد.

نحوه اجرای آزمون‌ها

پانویس‌های روش‌شناسی حاوی نکته‌ای است که خلاصه‌ها از آن صرف‌نظر کرده‌اند. زhipu GLM-5.3 را روی CyberGym، ExploitGym، ExploitBench، Terminal Bench و چندین وظیفه دیگر داخل Claude Code 2.1.207، عامل کدنویسی آنتروپیک، ارزیابی کرده است.

این کار نامناسب نیست. استفاده از harness مشترک میان مدل‌ها روشی برای حفظ انصاف مقایسه است و زhipu تنظیمات مورد استفاده را مستند کرده است. با این حال، شایان توجه است که ادعاهای مرزی یک مدل وزن‌باز چینی از طریق نرم‌افزار عامل آمریکایی اندازه‌گیری می‌شود.

دو جزئیات دیگر پیش از تلقی نتیجه CyberGym به عنوان قطعی، شایسته توجه هستند. امتیاز یک اجرای واحد است که به صورت pass@1 روی ۱۵۰۷ وظیفه گزارش شده و هیچ رقم واریانسی ارائه نشده است. فاصله هفت‌دهم امتیازی بین دو اجرای واحد، فاصله‌ای نیست که بتوان بر آن تکیه کرد. همچنین بودجه‌های زمانی ExploitGym با نرخ‌های throughput از Artificial Analysis نرمال‌سازی شده‌اند.

تعداد آسیب‌پذیری‌ها و عددی که غایب است

فراتر از بنچمارک‌ها، زhipu اعلام کرده که با تیم‌های امنیتی چین همکاری کرده و مدل‌های خود را روی کدبیس‌های واقعی اجرا کرده و ۲۴۳۶ آسیب‌پذیری را در ۲۶۹ پروژه متن‌باز شناسایی کرده است. توزیع شدت شامل ۱۰۷ بحرانی، ۹۹۰ بالا، ۱۲۸۶ متوسط و ۵۳ پایین است. قدیمی‌ترین نقص به سال ۱۹۸۱ بازمی‌گردد و میانگین آسیب‌پذیری ۲۶.۶ سال در کد باقی مانده بود.

یک ناهماهنگی شایسته دقت است. پنل خلاصه زhipu ۱۰۹۷ یافته را بحرانی و بالا برچسب زده که با جدول شدت مطابقت دارد، اما متن بدنه همان انتشار این ۱۰۹۷ را متوسط تا بالا توصیف کرده است.

تعداد پس از بررسی کارشناسی، غربالگری و حذف تکرار گزارش شده، بنابراین خروجی خام مدل نیست. از ۲۴۳۶ یافته، ۵۳ مورد به صورت عمومی افشا شده و ۲۳۸۳ مورد همچنان تحت embargo هستند. انتشار نمی‌گوید چند مورد قبلاً ناشناخته بوده‌اند و چند مورد به طور مستقل بازتولید شده‌اند.

آنچه مهم‌تر از جدول بنچمارک است

دو نکته در انتشار، پیامدهای بلندمدت‌تری نسبت به حاشیه CyberGym دارند.

نخست کارایی است. زhipu گزارش می‌دهد GLM-5.3 در بنچمارک داخلی کدنویسی به ۳۱.۴ درصد با حدود ۵۰٬۰۰۰ توکن خروجی per task رسیده، در حالی که Opus 4.8 با ۱۲۰٬۰۰۰ توکن به ۲۹.۵ درصد دست یافته است. عملکرد اندکی بهتر با کمتر از نیمی از توکن‌ها، استدلال هزینه‌ای ایجاد می‌کند.

دوم توزیع است. زhipu اعلام کرده وزن‌ها پس از تکمیل ارزیابی و hardening ایمنی منتشر خواهند شد. این کار هنوز انجام نشده و تا آن زمان، ادعای وزن‌باز یک تعهد است نه واقعیت. در صورت تحقق، مدلی با قابلیت مستند کشف آسیب‌پذیری در دسترس هر تیمی قرار می‌گیرد.

وزن‌ها تا پایان اوت منتشر خواهند شد.

نظرات

ثبت نظر جدید

برای ثبت نظر باید وارد حساب کاربری شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده است. اولین نفر باشید!