B o t I r a n

متا مدل Muse Glimmer را برای عوامل هوش مصنوعی محلی منتشر کرد

متا مدل Muse Glimmer را برای عوامل هوش مصنوعی محلی منتشر کرد

متا مدل Muse Glimmer را با مجوز Apache 2.0 منتشر کرده است. این مدل ۳۰ میلیارد پارامتری برای اجرای عوامل هوش مصنوعی محلی روی GPUهای مصرفی طراحی شده و قابلیت‌هایی مانند کدنویسی محلی و ارزیابی را فراهم می‌کند.

متا مدل Muse Glimmer را تحت مجوز Apache 2.0 منتشر کرده است. آزمایشگاه Superintelligence این شرکت وزن‌های مدل ۳۰ میلیارد پارامتری را روی Hugging Face منتشر کرده است. متا اعلام کرده که توسعه‌دهندگان می‌توانند از این مدل برای کدنویسی محلی، فراخوانی توابع، عوامل محلی و ارزیابی LLM-as-a-judge استفاده کنند.

این انتشار محدودیت عملیاتی تیم‌های هوش مصنوعی را هدف قرار می‌دهد که مدل‌های میزبانی‌شده در ابر نیازمند دسترسی شبکه و زیرساخت مرکزی هستند. متا Muse Glimmer را برای بارهای کاری که به مدل روی دستگاه نیاز دارند، از جمله عوامل شخصی با دسترسی به برنامه‌ها، پیام‌ها، فایل‌ها و سایر زمینه‌های خصوصی پیشنهاد می‌کند.

متا Muse Glimmer در چندین بنچمارک وظیفه عامل پیشرو است

آزمایش‌های بنچمارک متا Muse Glimmer را در پنج مورد از هشت بنچمارک عامل عمومی از Gemma4-31B و Qwen3.6-27B جلوتر قرار داده است. این مدل در MCP Atlas امتیاز ۷۵.۵ کسب کرد، در حالی که Gemma4-31B امتیاز ۵۴.۲ و Qwen3.6-27B امتیاز ۶۲.۵ را ثبت کردند.

در بنچمارک DeepSearch QA نیز الگوی مشابهی مشاهده شد. متا امتیاز ۷۴.۶ را برای Muse Glimmer گزارش کرده است، در مقابل ۶۱.۷ برای Gemma4-31B و ۷۱.۱ برای Qwen3.6-27B. هر دو بنچمارک توانایی عامل در کار با اسکافولدها و تکمیل درخواست‌های چندمرحله‌ای را می‌سنجند.

این مدل در τ²-Banking امتیاز ۲۳.۵ کسب کرد، در حالی که Gemma4-31B امتیاز ۱۵.۱ و Qwen3.6-27B امتیاز ۱۶.۷ را ثبت کردند. Muse Glimmer همچنین در WildClawBench امتیاز ۴۷.۶ به دست آورد که بالاتر از ۳۷.۶ Gemma4-31B و ۴۳.۲ Qwen3.6-27B است. نتیجه GAIA2 آن نیز به ۴۳.۳ رسید، در مقایسه با ۳۶.۴ و ۴۰.۰ به ترتیب.

برخی امتیازات عامل به نفع Qwen3.6-27B است. جدول متا امتیاز ۱۱۴۱ را برای این مدل در GDPval-AA نشان می‌دهد، در مقابل ۹۵۳ Muse Glimmer و ۸۱۱ Gemma4-31B. Qwen3.6-27B همچنین در SkillsBench با امتیاز ۴۶.۶ پیشتاز بود، جایی که Muse Glimmer امتیاز ۴۴.۳ را ثبت کرد.

در OSWorld-Verified بیشترین شکاف مشاهده شد. متا امتیاز ۷۵.۶ را برای Qwen3.6-27B گزارش کرده است، Muse Glimmer به ۶۵.۹ رسید و Gemma4-31B امتیاز ۵۸.۵ را کسب کرد.

این آزمون‌ها وظایف محدود را می‌سنجند و نشان نمی‌دهند که یک عامل محلی پس از اتصال به فایل‌ها، تقویم‌ها، سیستم‌های پیام‌رسانی یا ابزارهای داخلی یک سازمان چگونه عمل خواهد کرد.

نتایج کدنویسی بین Muse Glimmer و Qwen تقسیم شده است

نتایج کدنویسی Muse Glimmer مقایسه نزدیک‌تری نشان می‌دهد. این مدل در SWE-Bench Pro با امتیاز ۵۱.۲ پیشتاز بود. متا امتیاز ۳۶.۹ را برای Gemma4-31B و ۵۰.۲ را برای Qwen3.6-27B گزارش کرده است.

در SciCode نتیجه نزدیک بود. Muse Glimmer امتیاز ۴۳.۶ کسب کرد که اندکی بالاتر از ۴۳.۴ Gemma4-31B است. Qwen3.6-27B امتیاز ۳۹.۸ را ثبت کرد.

Qwen3.6-27B در دو ارزیابی کدنویسی دیگر پیشتاز بود. این مدل در SWE-Bench Verified امتیاز ۷۷.۲ کسب کرد، در مقایسه با ۷۶.۰ Muse Glimmer. TerminalBench 2.1 امتیاز ۶۰.۷ را به Qwen3.6-27B داد، Muse Glimmer به ۵۱.۷ رسید و Gemma4-31B امتیاز ۴۳.۴ را ثبت کرد.

یک عامل کدنویسی محلی بیش از تولید کد انجام می‌دهد. این عامل به اسکافولدی نیاز دارد که تصمیم بگیرد کدام مخازن، ترمینال‌ها، محیط‌های آزمایشی و دستورات در دسترس مدل قرار گیرند. متا اعلام کرده Muse Glimmer از الگوهای OpenClaw و سایر الگوهای هماهنگی عامل پشتیبانی می‌کند و اسکافولدهای سفارشی در مستندات توسعه‌دهندگان پوشش داده شده‌اند.

سازمانی که مدل را برای کارهای نرم‌افزاری ارزیابی می‌کند باید دستورات و مخازن در دسترس عامل را پیش از اندازه‌گیری موفقیت وظیفه تعریف کند. مواد ارائه‌شده آموزش بازآزمایی برای فراخوانی‌های ناموفق ابزار را توصیف می‌کند. این رفتار نیازمند کنترل بر تلاش‌های تکراری است، به‌ویژه جایی که ابزار می‌تواند کد منبع را تغییر دهد یا سیستم خارجی را فراخوانی کند.

امتیازات چندوجهی در بیشتر آزمون‌ها به نفع Qwen است

Muse Glimmer متن و تصویر درهم‌تنیده را از طریق انکودر ادراک اختصاصی می‌پذیرد. متا می‌گوید این طراحی به عوامل اجازه می‌دهد اسکرین‌شات‌ها، نمودارها و اسناد را به عنوان بخشی از مکالمه تفسیر کنند.

نمودار بنچمارک Muse Glimmer را در Charxiv Reasoning پیشتاز نشان می‌دهد. امتیاز آن به ۷۸.۸ رسید، در مقابل ۷۷.۷ برای Gemma4-31B و ۷۸.۴ برای Qwen3.6-27B.

Qwen3.6-27B در ScreenSpot Pro با امتیاز ۷۶.۱ پیشتاز بود. Muse Glimmer امتیاز ۷۵.۴ و Gemma4-31B امتیاز ۷۵.۹ را ثبت کردند. همین مدل در OmniDocBench v1.5 با امتیاز ۷۷.۸ پیشتاز بود، در مقایسه با ۷۵.۸ Muse Glimmer و ۷۲.۵ Gemma4-31B.

در MMMU Pro تفاوت‌ها کوچک‌تر بود. متا Muse Glimmer را با امتیاز ۷۴ فهرست کرده است، Qwen3.6-27B به ۷۵ رسید و Gemma4-31B امتیاز ۷۳ را کسب کرد.

این نتایج برای تیم‌هایی که عوامل عمل‌کننده روی رابط‌های بصری را در نظر می‌گیرند اهمیت دارد. مدلی که اسکرین‌شات می‌خواند می‌تواند آنچه را می‌بیند تفسیر کند، اما آزمایش محلی همچنان باید مجوزها، چیدمان نمایشگر، فرمت اسناد و خطاهای بازگردانده‌شده توسط ابزارهای متصل را پوشش دهد.

ارقام ایمنی نرخ موفقیت حمله کمتری نسبت به Qwen نشان می‌دهد

متا همچنین دو ارزیابی مرتبط با ایمنی را گزارش کرده است: CI Memories و Siren AgentDojo. نمودار از معیارهای متفاوتی برای هر آزمون استفاده می‌کند.

در CI Memories متا نرخ نقض ۲۶.۴ و امتیاز پوشش ۶۴.۸ را برای Muse Glimmer فهرست کرده است. Gemma4-31B نرخ نقض ۱۲.۱ با پوشش ۵۳.۰ ثبت کرد. Qwen3.6-27B نرخ نقض ۵۳.۴ و پوشش ۶۶.۹ را ثبت کرد.

نتیجه Siren AgentDojo از نرخ موفقیت حمله و سودمندی استفاده می‌کند. متا نرخ موفقیت حمله ۲۸.۴ و امتیاز سودمندی ۹۴.۲ را برای Muse Glimmer ارائه کرده است. Gemma4-31B امتیاز ۲۵.۶ در نرخ موفقیت حمله با سودمندی ۹۰.۸ کسب کرد. Qwen3.6-27B نرخ ۴۰.۳ و سودمندی ۹۲.۷ را ثبت کرد.

نتایج استدلال عمومی زمینه‌ای به ادعاهای عامل اضافه می‌کند

Muse Glimmer در چهار مورد از شش آزمون قابلیت‌های عمومی و استدلال در مقایسه متا پیشتاز بود. این مدل در IFBench امتیاز ۷۷.۰ کسب کرد. Gemma4-31B امتیاز ۷۶.۰ و Qwen3.6-27B امتیاز ۷۰.۸ را ثبت کردند.

امتیاز AIME 2026 برای Muse Glimmer ۹۴.۷ بود. متا امتیاز ۸۹.۲ را برای Gemma4-31B و ۹۴.۱ را برای Qwen3.6-27B گزارش کرده است. در AA-LCR Muse Glimmer به ۸۰.۰ رسید که بالاتر از ۶۸.۳ و ۷۳.۳ است.

این مدل همچنین در Beam 128K با امتیاز ۶۵.۱ پیشتاز بود. Qwen3.6-27B امتیاز ۶۳.۰ و Gemma4-31B امتیاز ۵۸.۲ را ثبت کردند.

Gemma4-31B در GPQA Diamond با امتیاز ۸۵.۷ پیشتاز بود. Muse Glimmer امتیاز ۸۳.۵ و Qwen3.6-27B امتیاز ۸۴.۲ را کسب کرد. Gemma4-31B همچنین بالاترین امتیاز Humanity’s Last Exam, Text No Tools را با ۲۳.۶ به دست آورد؛ Muse Glimmer به ۲۲.۰ رسید.

هیچ مدلی در همه آزمون‌ها پیشتاز نیست. نتایج متا نشان می‌دهد Muse Glimmer در مجموعه‌ای متنوع از ارزیابی‌های عامل، کدنویسی، بصری، ایمنی و استدلال با دو مدل با اندازه مشابه رقابت نزدیک دارد.

محدودیت‌های حافظه طراحی استقرار محلی را شکل می‌دهد

متا می‌گوید مدل ۳۰ میلیارد پارامتری با دقت کامل به بیش از ۵۵ گیگابایت حافظه نیاز دارد. Muse Glimmer به جای آن از کوانتیزاسیون وزنی تقریباً ۴ بیتی استفاده می‌کند که مدل زبانی را به کمتر از ۲۰ گیگابایت کاهش می‌دهد.

این تخصیص حافظه برای کش KV باقی می‌گذارد. مدل همچنین به فضای انکودر ادراک و درافتر رمزگشایی حدسی نیاز دارد. متا محدوده حافظه ۲۴ یا ۳۲ گیگابایتی را برای این اجزا هدف قرار داده است.

این شرکت می‌گوید درافتر مبتنی بر DFlash بلوک‌هایی از توکن‌ها را پیشنهاد می‌دهد تا مدل اصلی به صورت موازی تأیید کند. متا اعلام کرده این روش تولید را نسبت به خروجی توکن به توکن استاندارد سریع‌تر می‌کند و کیفیت خروجی یکسانی را حفظ می‌نماید. پست ارائه‌شده ارقام توکن بر ثانیه، اندازه پرامپت، داده‌های توان یا نتایج همزمانی را شامل نمی‌شود.

متا نسخه K-Quant-17GB خود را با درافتر کوانتیزه‌شده DFlash روی سخت‌افزار MacBook M4-Max، MacBook M5-Max و RTX-5090 آزمایش کرده است. این شرکت تجربه حاصل را برای مکالمه روان و تعامل عامل بلادرنگ مناسب توصیف کرده است.

وزن‌های عمومی از طریق Hugging Face در دسترس هستند. متا اعلام کرده ادغام با llama.cpp، MLX و ExecuTorch در روزهای آینده ارائه خواهد شد.

نظرات

ثبت نظر جدید

برای ثبت نظر باید وارد حساب کاربری شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده است. اولین نفر باشید!