متا مدل Muse Glimmer را تحت مجوز Apache 2.0 منتشر کرده است. آزمایشگاه Superintelligence این شرکت وزنهای مدل ۳۰ میلیارد پارامتری را روی Hugging Face منتشر کرده است. متا اعلام کرده که توسعهدهندگان میتوانند از این مدل برای کدنویسی محلی، فراخوانی توابع، عوامل محلی و ارزیابی LLM-as-a-judge استفاده کنند.
این انتشار محدودیت عملیاتی تیمهای هوش مصنوعی را هدف قرار میدهد که مدلهای میزبانیشده در ابر نیازمند دسترسی شبکه و زیرساخت مرکزی هستند. متا Muse Glimmer را برای بارهای کاری که به مدل روی دستگاه نیاز دارند، از جمله عوامل شخصی با دسترسی به برنامهها، پیامها، فایلها و سایر زمینههای خصوصی پیشنهاد میکند.
متا Muse Glimmer در چندین بنچمارک وظیفه عامل پیشرو است
آزمایشهای بنچمارک متا Muse Glimmer را در پنج مورد از هشت بنچمارک عامل عمومی از Gemma4-31B و Qwen3.6-27B جلوتر قرار داده است. این مدل در MCP Atlas امتیاز ۷۵.۵ کسب کرد، در حالی که Gemma4-31B امتیاز ۵۴.۲ و Qwen3.6-27B امتیاز ۶۲.۵ را ثبت کردند.
در بنچمارک DeepSearch QA نیز الگوی مشابهی مشاهده شد. متا امتیاز ۷۴.۶ را برای Muse Glimmer گزارش کرده است، در مقابل ۶۱.۷ برای Gemma4-31B و ۷۱.۱ برای Qwen3.6-27B. هر دو بنچمارک توانایی عامل در کار با اسکافولدها و تکمیل درخواستهای چندمرحلهای را میسنجند.
این مدل در τ²-Banking امتیاز ۲۳.۵ کسب کرد، در حالی که Gemma4-31B امتیاز ۱۵.۱ و Qwen3.6-27B امتیاز ۱۶.۷ را ثبت کردند. Muse Glimmer همچنین در WildClawBench امتیاز ۴۷.۶ به دست آورد که بالاتر از ۳۷.۶ Gemma4-31B و ۴۳.۲ Qwen3.6-27B است. نتیجه GAIA2 آن نیز به ۴۳.۳ رسید، در مقایسه با ۳۶.۴ و ۴۰.۰ به ترتیب.
برخی امتیازات عامل به نفع Qwen3.6-27B است. جدول متا امتیاز ۱۱۴۱ را برای این مدل در GDPval-AA نشان میدهد، در مقابل ۹۵۳ Muse Glimmer و ۸۱۱ Gemma4-31B. Qwen3.6-27B همچنین در SkillsBench با امتیاز ۴۶.۶ پیشتاز بود، جایی که Muse Glimmer امتیاز ۴۴.۳ را ثبت کرد.
در OSWorld-Verified بیشترین شکاف مشاهده شد. متا امتیاز ۷۵.۶ را برای Qwen3.6-27B گزارش کرده است، Muse Glimmer به ۶۵.۹ رسید و Gemma4-31B امتیاز ۵۸.۵ را کسب کرد.
این آزمونها وظایف محدود را میسنجند و نشان نمیدهند که یک عامل محلی پس از اتصال به فایلها، تقویمها، سیستمهای پیامرسانی یا ابزارهای داخلی یک سازمان چگونه عمل خواهد کرد.
نتایج کدنویسی بین Muse Glimmer و Qwen تقسیم شده است
نتایج کدنویسی Muse Glimmer مقایسه نزدیکتری نشان میدهد. این مدل در SWE-Bench Pro با امتیاز ۵۱.۲ پیشتاز بود. متا امتیاز ۳۶.۹ را برای Gemma4-31B و ۵۰.۲ را برای Qwen3.6-27B گزارش کرده است.
در SciCode نتیجه نزدیک بود. Muse Glimmer امتیاز ۴۳.۶ کسب کرد که اندکی بالاتر از ۴۳.۴ Gemma4-31B است. Qwen3.6-27B امتیاز ۳۹.۸ را ثبت کرد.
Qwen3.6-27B در دو ارزیابی کدنویسی دیگر پیشتاز بود. این مدل در SWE-Bench Verified امتیاز ۷۷.۲ کسب کرد، در مقایسه با ۷۶.۰ Muse Glimmer. TerminalBench 2.1 امتیاز ۶۰.۷ را به Qwen3.6-27B داد، Muse Glimmer به ۵۱.۷ رسید و Gemma4-31B امتیاز ۴۳.۴ را ثبت کرد.
یک عامل کدنویسی محلی بیش از تولید کد انجام میدهد. این عامل به اسکافولدی نیاز دارد که تصمیم بگیرد کدام مخازن، ترمینالها، محیطهای آزمایشی و دستورات در دسترس مدل قرار گیرند. متا اعلام کرده Muse Glimmer از الگوهای OpenClaw و سایر الگوهای هماهنگی عامل پشتیبانی میکند و اسکافولدهای سفارشی در مستندات توسعهدهندگان پوشش داده شدهاند.
سازمانی که مدل را برای کارهای نرمافزاری ارزیابی میکند باید دستورات و مخازن در دسترس عامل را پیش از اندازهگیری موفقیت وظیفه تعریف کند. مواد ارائهشده آموزش بازآزمایی برای فراخوانیهای ناموفق ابزار را توصیف میکند. این رفتار نیازمند کنترل بر تلاشهای تکراری است، بهویژه جایی که ابزار میتواند کد منبع را تغییر دهد یا سیستم خارجی را فراخوانی کند.
امتیازات چندوجهی در بیشتر آزمونها به نفع Qwen است
Muse Glimmer متن و تصویر درهمتنیده را از طریق انکودر ادراک اختصاصی میپذیرد. متا میگوید این طراحی به عوامل اجازه میدهد اسکرینشاتها، نمودارها و اسناد را به عنوان بخشی از مکالمه تفسیر کنند.
نمودار بنچمارک Muse Glimmer را در Charxiv Reasoning پیشتاز نشان میدهد. امتیاز آن به ۷۸.۸ رسید، در مقابل ۷۷.۷ برای Gemma4-31B و ۷۸.۴ برای Qwen3.6-27B.
Qwen3.6-27B در ScreenSpot Pro با امتیاز ۷۶.۱ پیشتاز بود. Muse Glimmer امتیاز ۷۵.۴ و Gemma4-31B امتیاز ۷۵.۹ را ثبت کردند. همین مدل در OmniDocBench v1.5 با امتیاز ۷۷.۸ پیشتاز بود، در مقایسه با ۷۵.۸ Muse Glimmer و ۷۲.۵ Gemma4-31B.
در MMMU Pro تفاوتها کوچکتر بود. متا Muse Glimmer را با امتیاز ۷۴ فهرست کرده است، Qwen3.6-27B به ۷۵ رسید و Gemma4-31B امتیاز ۷۳ را کسب کرد.
این نتایج برای تیمهایی که عوامل عملکننده روی رابطهای بصری را در نظر میگیرند اهمیت دارد. مدلی که اسکرینشات میخواند میتواند آنچه را میبیند تفسیر کند، اما آزمایش محلی همچنان باید مجوزها، چیدمان نمایشگر، فرمت اسناد و خطاهای بازگرداندهشده توسط ابزارهای متصل را پوشش دهد.
ارقام ایمنی نرخ موفقیت حمله کمتری نسبت به Qwen نشان میدهد
متا همچنین دو ارزیابی مرتبط با ایمنی را گزارش کرده است: CI Memories و Siren AgentDojo. نمودار از معیارهای متفاوتی برای هر آزمون استفاده میکند.
در CI Memories متا نرخ نقض ۲۶.۴ و امتیاز پوشش ۶۴.۸ را برای Muse Glimmer فهرست کرده است. Gemma4-31B نرخ نقض ۱۲.۱ با پوشش ۵۳.۰ ثبت کرد. Qwen3.6-27B نرخ نقض ۵۳.۴ و پوشش ۶۶.۹ را ثبت کرد.
نتیجه Siren AgentDojo از نرخ موفقیت حمله و سودمندی استفاده میکند. متا نرخ موفقیت حمله ۲۸.۴ و امتیاز سودمندی ۹۴.۲ را برای Muse Glimmer ارائه کرده است. Gemma4-31B امتیاز ۲۵.۶ در نرخ موفقیت حمله با سودمندی ۹۰.۸ کسب کرد. Qwen3.6-27B نرخ ۴۰.۳ و سودمندی ۹۲.۷ را ثبت کرد.
نتایج استدلال عمومی زمینهای به ادعاهای عامل اضافه میکند
Muse Glimmer در چهار مورد از شش آزمون قابلیتهای عمومی و استدلال در مقایسه متا پیشتاز بود. این مدل در IFBench امتیاز ۷۷.۰ کسب کرد. Gemma4-31B امتیاز ۷۶.۰ و Qwen3.6-27B امتیاز ۷۰.۸ را ثبت کردند.
امتیاز AIME 2026 برای Muse Glimmer ۹۴.۷ بود. متا امتیاز ۸۹.۲ را برای Gemma4-31B و ۹۴.۱ را برای Qwen3.6-27B گزارش کرده است. در AA-LCR Muse Glimmer به ۸۰.۰ رسید که بالاتر از ۶۸.۳ و ۷۳.۳ است.
این مدل همچنین در Beam 128K با امتیاز ۶۵.۱ پیشتاز بود. Qwen3.6-27B امتیاز ۶۳.۰ و Gemma4-31B امتیاز ۵۸.۲ را ثبت کردند.
Gemma4-31B در GPQA Diamond با امتیاز ۸۵.۷ پیشتاز بود. Muse Glimmer امتیاز ۸۳.۵ و Qwen3.6-27B امتیاز ۸۴.۲ را کسب کرد. Gemma4-31B همچنین بالاترین امتیاز Humanity’s Last Exam, Text No Tools را با ۲۳.۶ به دست آورد؛ Muse Glimmer به ۲۲.۰ رسید.
هیچ مدلی در همه آزمونها پیشتاز نیست. نتایج متا نشان میدهد Muse Glimmer در مجموعهای متنوع از ارزیابیهای عامل، کدنویسی، بصری، ایمنی و استدلال با دو مدل با اندازه مشابه رقابت نزدیک دارد.
محدودیتهای حافظه طراحی استقرار محلی را شکل میدهد
متا میگوید مدل ۳۰ میلیارد پارامتری با دقت کامل به بیش از ۵۵ گیگابایت حافظه نیاز دارد. Muse Glimmer به جای آن از کوانتیزاسیون وزنی تقریباً ۴ بیتی استفاده میکند که مدل زبانی را به کمتر از ۲۰ گیگابایت کاهش میدهد.
این تخصیص حافظه برای کش KV باقی میگذارد. مدل همچنین به فضای انکودر ادراک و درافتر رمزگشایی حدسی نیاز دارد. متا محدوده حافظه ۲۴ یا ۳۲ گیگابایتی را برای این اجزا هدف قرار داده است.
این شرکت میگوید درافتر مبتنی بر DFlash بلوکهایی از توکنها را پیشنهاد میدهد تا مدل اصلی به صورت موازی تأیید کند. متا اعلام کرده این روش تولید را نسبت به خروجی توکن به توکن استاندارد سریعتر میکند و کیفیت خروجی یکسانی را حفظ مینماید. پست ارائهشده ارقام توکن بر ثانیه، اندازه پرامپت، دادههای توان یا نتایج همزمانی را شامل نمیشود.
متا نسخه K-Quant-17GB خود را با درافتر کوانتیزهشده DFlash روی سختافزار MacBook M4-Max، MacBook M5-Max و RTX-5090 آزمایش کرده است. این شرکت تجربه حاصل را برای مکالمه روان و تعامل عامل بلادرنگ مناسب توصیف کرده است.
وزنهای عمومی از طریق Hugging Face در دسترس هستند. متا اعلام کرده ادغام با llama.cpp، MLX و ExecuTorch در روزهای آینده ارائه خواهد شد.


نظرات
ثبت نظر جدید
هنوز نظری ثبت نشده است. اولین نفر باشید!