مقاله

جمنای ۳.۸ فلش گوگل برای عامل‌های هوشمند طراحی شده و نسخه سایبری آن در جستجوی آسیب‌پذیری‌هاست

مدل ۳.۸ فلش سایبری گوگل، قابلیت شناسایی و رفع آسیب‌پذیری‌ها را بهبود می‌بخشد و با هزینه کمتر از مدل‌های بزرگ‌تر عملکرد بهتری نشان می‌دهد؛ امری حیاتی برای تیم‌های امنیت سایبری.

  • ۱۴۰۵/۰۶/۱۲
  • مدیر سیستم
  • 7 دقیقه مطالعه

گوگل همچنان در حال ارائه مدل‌های Flash است: این شرکت در روز چهارشنبه دو نسخه از یک مدل جدید به نام 3.8 Flash را معرفی کرد. 

این نسخه‌ها شامل یک Flash استاندارد، یک مدل «کاربردی» (workhorse) برای وظایف عاملی (agentic)، توسعه نرم‌افزار و استدلال چندمرحله‌ای، و Flash Cyber بهینه‌شده برای شناسایی و رفع آسیب‌پذیری‌ها هستند.

سوندار پیچای، مدیرعامل گوگل، در یک پست در X گفت که 3.8 Flash «پرش‌های قابل‌توجهی» نسبت به 3.7 Flash در زمینه مهندسی نرم‌افزار، وظایف عاملی و استدلال چندمرحله‌ای دارد. برای مثال، این مدل در بنچمارک کدنویسی DeepSWE عملکرد بهتری نسبت به بسیاری از مدل‌های بزرگ پیشرو (frontier) داشت، در حالی که هزینه بسیار کمتری داشت. 

در همین حال، پیچای گفت که Flash Cyber «قوی‌ترین» مدل امنیت سایبری شرکت است؛ این مدل همچنین در شناسایی آسیب‌پذیری‌ها و رفع آن‌ها در مقیاس بزرگ، عملکردی در سطح مدل‌های پیشرو دارد. این مدل ۸۶.۲ درصد در بنچمارک امنیت سایبری CyberGym و ۴۷.۲ درصد در CWE-Bench، که قابلیت‌های رفع آسیب‌پذیری هوش مصنوعی را ارزیابی می‌کند، کسب کرد. پیچای گفت که در یک بنچمارک داخلی گوگل، این مدل نرخ موفقیت بیش از ۷۰ درصدی در شناسایی آسیب‌پذیری‌ها در ۲۰ زبان برنامه‌نویسی مختلف داشت. 

نسخه 3.8 سومین انتشار Flash گوگل در شش هفته اخیر است و بلافاصله پس از نسخه 3.7 ارائه شد. 

3.8 با «تلاش بیشتر» و «دقت بالاتر» کار می‌کند

3.8 Flash اکنون در Gemini Enterprise در دسترس است؛ توسعه‌دهندگان می‌توانند از طریق Google AI Studio، Google Antigravity، Android Studio یا برای تولید رابط‌های کاربری در Stitch از آن استفاده کنند. قیمت آن ۰.۷۵ دلار برای هر میلیون توکن ورودی و ۳.۷۵ دلار برای هر میلیون توکن خروجی است — همان قیمت معرفی اولیه Gemini 3.7 Flash — و کاربران می‌توانند سطح تلاش مدل را بر اساس نیازهای خود در زمینه کیفیت، هزینه و تأخیر (latency) سفارشی‌سازی و تنظیم کنند.

برای مثال، زمانی که کارایی محاسباتی اولویت دارد، می‌توانند سربار توکن را کاهش دهند یا صرفاً با 3.7 Flash که «به طور کامل برای بارهای کاری اولویت‌دار کارایی پشتیبانی می‌شود» ادامه دهند، همان‌طور که تولسی دوشی، مدیر ارشد محصول گوگل، و رالوکا آدا پوپا، مسئول امنیت Gemini، در یک پست وبلاگ نوشتند. 

دوشی و پوپا اشاره می‌کنند که «3.8 Flash سخت‌تر کار می‌کند» و با «دقت بالاتری» وظایف پیچیده مانند اجرای مراحل اضافی استدلال را انجام می‌دهد، هرچند گاهی ممکن است برای به حداکثر رساندن عملکرد از توکن‌های بیشتری استفاده کند. این مدل دارای پنجره ورودی ۱ میلیون توکن و سقف خروجی ۶۴ هزار توکن است و می‌تواند متن، تصاویر، صدا، ویدیو و فایل‌های PDF را پردازش کند. 

3.8 Flash در بنچمارک‌های متعددی که کدنویسی، قابلیت‌های چندوجهی (multimodal)، استفاده از رایانه، زمینه طولانی (long-context)، کارهای دانشی و استدلال علمی را آزمایش می‌کنند، ارزیابی شد. گوگل می‌گوید که این مدل در حوزه‌های دانش تخصصی که نیازمند تحلیل و گزارش‌دهی عمیق‌تر هستند نیز عملکرد خوبی دارد. برای مثال، این مدل در بنچمارک‌هایی مانند Vals Finance Agent V2 برای مالی و Harvey's Legal Agent Benchmark برای حقوق، عملکرد بهتری نسبت به نسخه قبلی خود و سایر مدل‌های پیشرو داشت؛ همچنین ۵۴.۹ درصد در Humanity’s Last Exam (HLE)-Verified کسب کرد که نشان‌دهنده توانایی آن در انجام وظایف استدلالی چندمرحله‌ای در موضوعاتی مانند ریاضی، علوم و علوم انسانی است. 

در یک نمونه‌ای که گوگل به اشتراک گذاشت، Gemini 3.8 Flash با یک پرامپت ساده و استفاده از تکنیک‌های حلقه‌ای (looping) در پلتفرم Antigravity گوگل، یک بازی ساخت. این بازی از پازل‌ها، روایت‌هایی که بر اساس محیط تغییر می‌کنند و تصاویر و بافت‌هایی از Nano Banana برای ایجاد یک تجربه سه‌بعدی (در این مورد، یک جادوگر که در یک قلعه حرکت می‌کند) استفاده می‌کند. 

در نمونه‌های دیگر، مدل یک نسخه کاملاً کاربردی از گوگل‌مپس برای سیستم‌عامل DOS ایجاد کرد که شامل مکان‌های تعاملی، مسیرهای حرکت و نمای خیابان بود؛ یک بصری‌ساز سه‌بعدی که به‌طور خودکار دستگاه‌ها را برای بازرسی به لایه‌های مجزا تجزیه می‌کرد و قابلیت اسلایدر داشت؛ و یک نقشه توپوگرافی از اماکن جغرافیایی مشهور بر اساس داده‌های واقعی از اداره زمین‌شناسی ایالات متحده (USGS)، همراه با برش‌های عرضی بلادرنگ، تصویرسازی‌های دوبعدی و توضیحات علمی. 

بر اساس گزارش Arena.ai، مدل 3.8 Flash در رتبه ۱۴ در Agent Arena قرار گرفت و بالاتر از DeepSeek-V4-Pro رتبه‌بندی شد و جهش قابل‌توجهی نسبت به Gemini 3.7 Flash (که در رتبه ۳۲ قرار دارد) نشان داد. این مدل در Text Arena با رتبه ۷ معرفی شد و جلوتر از Claude Opus 5 و Gemini 3.7 Flash قرار گرفت. این نسخه در چندین حوزه نسبت به 3.7 Flash بهبود یافته است: درخواست‌های چندگانه، نگارش، ادبیات و زبان، پرسش‌های طولانی، پرامپت‌های دشوار، کدنویسی، پیروی از دستورات، خدمات نرم‌افزاری و فناوری اطلاعات، و همچنین کسب‌وکار، مدیریت و عملیات مالی. 

Flash Cyber از همین حالا در حال ایمن‌سازی کدهای گوگل است

Flash Cyber در ابتدا از طریق برنامه Fairwind گوگل در اختیار «مدافعان مورد اعتماد» قرار می‌گیرد؛ برنامه‌ای که اولویت را با مقامات دولتی، اپراتورهای زیرساخت‌های حیاتی و سایر شرکایی که به‌دنبال قابلیت‌های پیشرفته دفاع سایبری هستند، قرار می‌دهد. سازمان‌ها می‌توانند برای دسترسی به این مدل درخواست دهند. 

گوگل می‌گوید این نسخه از مدل در حوزه امنیت سایبری «آموزش دقیق» دیده است و نشان‌دهنده «پرش قابل‌توجهی در مقاومت در برابر تزریق پرامپت (Prompt Injection)» است. این مدل به‌ویژه در کشف خودکار آسیب‌پذیری‌ها — دست‌کم بر اساس بنچمارک‌های داخلی Gemini — و رفع خودکار آن‌ها (پچ‌زنی) مهارت بالایی دارد. همچنین طبق گفته پوپا در یک ویدیو، این مدل در کدنویسی نیز بسیار توانمند است. 

هدف این است که با تجهیز مدافعان به قابلیت‌های سطح کارشناسی، به آن‌ها برتری نسبت به بازیگران تهدید (چه بدخواه، چه عوامل هوش مصنوعی دیگر، چه هکرها) داده شود. دوشی و پوپا توضیح می‌دهند: «ما از ابتدا در رفع آسیب‌پذیری‌ها سرمایه‌گذاری کرده‌ایم و آن را بر قابلیت‌های تهاجمی مانند بهره‌برداری (Exploitation) اولویت داده‌ایم.» 

این مدل با مجموعه‌ای از کنترل‌های امنیتی (Mitigations) با انعطاف‌پذیری بیشتر برای حفاظت‌های سایبری عرضه می‌شود — به همین دلیل فعلاً فقط با شرکای محدود به اشتراک گذاشته می‌شود — و در برابر سوءاستفاده در حملات سایبری و حوزه‌هایی مانند شیمیایی، بیولوژیکی، رادیولوژیکی و هسته‌ای (CBRN) محافظت می‌کند. 

گوگل از 3.8 Flash Cyber برای ایمن‌سازی کدهای خود استفاده می‌کند؛ این مدل ۲.۶ برابر پچ‌های صحیح بیشتری برای آسیب‌پذیری‌های کروم تولید کرد، در مقایسه با مدل‌های تجاری بسیار بزرگ‌تر. 

Wiz — که گوگل اوایل امسال با مبلغ تاریخی ۳۲ میلیارد دلار آن را خرید — گزارش داد که 3.8 Flash Cyber در یک بنچمارک داخلی تست نفوذ، ۷.۵ تا ۹.۷ درصد یادآوری (Recall) بالاتری از آسیب‌پذیری‌های واقعی در دنیای واقعی داشت، در حالی که هزینه آن ۲.۳ تا ۵.۲ برابر کمتر از مدل‌های پیشرو (Frontier) بود. به‌طور مشابه، گروه تحقیقات آسیب‌پذیری ابری گوگل با استفاده از 3.8 Flash Cyber، یک آسیب‌پذیری حیاتی بنیادین را در کمتر از ۲ ساعت کشف کرد. گوگل ادعا می‌کند که معمولاً این تحقیق و کشف ماه‌ها زمان می‌برد. 

پوپا گفت عوامل هوش مصنوعی در یافتن و بهره‌برداری از آسیب‌پذیری‌ها «بسیار ماهر» هستند. اسکن پایگاه‌های کد بزرگ با مدل‌های بزرگ هوش مصنوعی پرهزینه است و مدافعان تحت فشار هستند. «در امنیت سایبری، مهاجمان فقط نیاز دارند یک نقص مهم را در میان میلیون‌ها خط کد پیدا کنند. مدافعان باید تمام آن نقص‌ها را برطرف کنند تا بتوانند در برابر مهاجمان دفاع کنند.» 

داگ ترنر، مدیر مهندسی کروم، از «فاجعه آسیب‌پذیری» در ماه‌های اخیر به دلیل هوش مصنوعی مولد (Generative AI) سخن گفت. او در یک ویدیو گفت: «فقط در یک شب، شاهد افزایشی به شکل چوب‌حقی (Hockey Stick) در تعداد آسیب‌پذیری‌های نرم‌افزاری گزارش‌شده از طریق برنامه تحقیقات آسیب‌پذیری خود بودیم.» 

او توضیح داد که یکی از آسیب‌پذیری‌های جالبی که ۳.۸ فلش سایبر کشف کرده بود، ۱۳ سال در کرومیوم و کروم وجود داشته است. این یک «باگ بسیار ظریف» بود که ده‌ها و شاید صدها مهندس آن را بررسی کرده بودند، اما هیچ‌گاه آن را شناسایی نکرده بودند. «ژمنی ۳.۸ فلش سایبر به ما امکان می‌دهد تا پیشنهادهای اصلاحی بهتری ارائه دهیم تا زندگی توسعه‌دهندگان بسیار آسان‌تر شود.» 

منبع: Google’s Gemini 3.8 Flash is built for agents, while its Cyber twin hunts vulnerabilities

مقالات