GLM-5.3-Flash بهعنوان نخستین مدل هوش مصنوعی چندحالته بومی در سری GLM-5 معرفی شد. این مدل با دراختیار داشتن مجموعاً ۳۲۰ میلیارد پارامتر، در هر گام پردازشی تنها ۱۸ میلیارد پارامتر فعال را درگیر میکند. طبق ارزیابیهای صورتگرفته، این ساختار باعث شده تا مدل مذکور با هزینهای در حدود یکدهم نسخههای پیشین، عملکردی بهتر از GLM-5.2 ثبت کند و در بنچمارکهای برنامهنویسی و امور ایجنتها به سطحی نزدیک به مدل Claude Opus 4.8 برسد.
طبق توضیحات شرکت سازنده، در ساختار این مدل از چند نوآوری معماری استفاده شده است. برای نخستینبار، یک معماری ترکیبی شامل توجه خطی (Linear Attention) و توجه تُنُک (Sparse Attention) در آن پیادهسازی شده که این امر هزینههای پردازش در ورودیهای طولانی تا سقف ۱ میلیون توکن را بهشدت کاهش میدهد.
همچنین استفاده از ساختار بهینهسازیشده mHC برای اتصال لایهها، در کنار آموزش مدل با یک مجموعهداده بزرگ ۳۰ تریلیون توکنی، باعث شده است تا این هوش مصنوعی بدون نیاز به پردازشهای سنگین و گرانقیمت، عملکرد بسیار هوشمندانهتری ارائه دهد.

این مدل پیش از عرضه رسمی، بهصورت آزمایشی و ناشناس با نام ox-alpha روی پلتفرمهای OpenCode و OpenRouter در دسترس کاربران قرار گرفته بود.
معماری نوین GLM-5.3-Flash برای کاهش چشمگیر هزینههای پردازشی
در مقایسه با نسلهای قبلی مانند سری GLM-4.5، مدل GLM-5.3-Flash با هدف کاهش چشمگیر هزینههای استنتاج طراحی شده است. با وجود تعداد پارامترهای کلی مشابه (۳۲۰ میلیارد در برابر ۳۵۵ میلیارد)، تعداد پارامترهای فعال و لایههای شبکه تقریباً به نصف کاهش یافته است. در بخش مدیریت حافظه، استفاده از ابزار فشردهسازی IndexPool باعث شده تا دادههای راهنما فضای کمتری اشغال کنند؛ در نتیجه توان پردازشی موردنیاز ۳ برابر و مصرف حافظه موقت در مقایسه با مدل GLM-5.3 تا ۴.۴ برابر کمتر و بهینهتر شده است. در شاخص هوش تحلیلی جامع نیز این مدل به امتیاز ۵۷ با هزینه ۰.۰۴۵ دلار در هر تسک دست یافته است.
در بخش کدنویسی، ادغام بومی بینایی هوش مصنوعی باعث شده تا مدل بتواند کدهای بصری مثل فرانتاند یا بازیسازی را خودش اجرا، مشاهده و اصلاح کند. همچنین این مدل روی شبکهای از تراشههای هوش مصنوعی چینی پیادهسازی شده که به لطف بهینهسازیهای نرمافزاری، بازدهی سختافزار تا ۳ برابر بیشتر و هزینههای آن با پردازندههای انویدیا همتراز شده است.
بنچمارک GLM-5.3-Flash
در ارزیابیهای فنی، مدل GLM-5.3-Flash در بنچمارک مهندسی نرمافزار DeepSWE v1.1 (سنجش حل خودکار باگها و توسعه واقعی نرمافزار) امتیاز ۶۳.۴ را ثبت کرد و عملکردی فراتر از نسل قبل یعنی GLM-5.2 (امتیاز ۴۶.۲) و حتی Claude Opus 4.8 (امتیاز ۵۸.۰) به نمایش گذاشته است.

در آزمون AutomationBench (سنجش هدایت خودکار سیستمها و اجرای فرایندهای عاملی پیوسته) با امتیاز ۴۸.۸ علاوهبر پیشی گرفتن از Opus 4.8 (امتیاز ۴۱.۰)، فاصله زیادی با نسل پیشین خود (۲۶.۲) ثبت کرد و پس از جمینای 3.7 فلش (امتیاز ۵۲.۳) در ردههای برتر ایستاد.
همچنین در ارزیابی بصری OfficeQA Pro (تحلیل اسناد و گزارشهای پیچیده مالی و اداری بدون دریافت متن خام) با دستیابی به امتیاز ۶۲.۴ توانست رقبای سرشناسی چون DeepSeek-V4-Vision با ۵۷.۹ و Claude Opus 4.8 با ۴۸.۹ را پشت سر بگذارد.
وزنهای GLM-5.3-Flash هماکنون بهشکل متنباز در HuggingFace در دسترس قرار گرفته است.
