مقاله
جمنای ۳.۸ فلش گوگل برای عاملهای هوشمند طراحی شده و نسخه سایبری آن در جستجوی آسیبپذیریهاست
مدل ۳.۸ فلش سایبری گوگل، قابلیت شناسایی و رفع آسیبپذیریها را بهبود میبخشد و با هزینه کمتر از مدلهای بزرگتر عملکرد بهتری نشان میدهد؛ امری حیاتی برای تیمهای امنیت سایبری.
- ۱۴۰۵/۰۶/۱۲
- مدیر سیستم
- 7 دقیقه مطالعه
گوگل همچنان در حال ارائه مدلهای Flash است: این شرکت در روز چهارشنبه دو نسخه از یک مدل جدید به نام 3.8 Flash را معرفی کرد.
این نسخهها شامل یک Flash استاندارد، یک مدل «کاربردی» (workhorse) برای وظایف عاملی (agentic)، توسعه نرمافزار و استدلال چندمرحلهای، و Flash Cyber بهینهشده برای شناسایی و رفع آسیبپذیریها هستند.
سوندار پیچای، مدیرعامل گوگل، در یک پست در X گفت که 3.8 Flash «پرشهای قابلتوجهی» نسبت به 3.7 Flash در زمینه مهندسی نرمافزار، وظایف عاملی و استدلال چندمرحلهای دارد. برای مثال، این مدل در بنچمارک کدنویسی DeepSWE عملکرد بهتری نسبت به بسیاری از مدلهای بزرگ پیشرو (frontier) داشت، در حالی که هزینه بسیار کمتری داشت.
در همین حال، پیچای گفت که Flash Cyber «قویترین» مدل امنیت سایبری شرکت است؛ این مدل همچنین در شناسایی آسیبپذیریها و رفع آنها در مقیاس بزرگ، عملکردی در سطح مدلهای پیشرو دارد. این مدل ۸۶.۲ درصد در بنچمارک امنیت سایبری CyberGym و ۴۷.۲ درصد در CWE-Bench، که قابلیتهای رفع آسیبپذیری هوش مصنوعی را ارزیابی میکند، کسب کرد. پیچای گفت که در یک بنچمارک داخلی گوگل، این مدل نرخ موفقیت بیش از ۷۰ درصدی در شناسایی آسیبپذیریها در ۲۰ زبان برنامهنویسی مختلف داشت.
نسخه 3.8 سومین انتشار Flash گوگل در شش هفته اخیر است و بلافاصله پس از نسخه 3.7 ارائه شد.
3.8 با «تلاش بیشتر» و «دقت بالاتر» کار میکند
3.8 Flash اکنون در Gemini Enterprise در دسترس است؛ توسعهدهندگان میتوانند از طریق Google AI Studio، Google Antigravity، Android Studio یا برای تولید رابطهای کاربری در Stitch از آن استفاده کنند. قیمت آن ۰.۷۵ دلار برای هر میلیون توکن ورودی و ۳.۷۵ دلار برای هر میلیون توکن خروجی است — همان قیمت معرفی اولیه Gemini 3.7 Flash — و کاربران میتوانند سطح تلاش مدل را بر اساس نیازهای خود در زمینه کیفیت، هزینه و تأخیر (latency) سفارشیسازی و تنظیم کنند.
برای مثال، زمانی که کارایی محاسباتی اولویت دارد، میتوانند سربار توکن را کاهش دهند یا صرفاً با 3.7 Flash که «به طور کامل برای بارهای کاری اولویتدار کارایی پشتیبانی میشود» ادامه دهند، همانطور که تولسی دوشی، مدیر ارشد محصول گوگل، و رالوکا آدا پوپا، مسئول امنیت Gemini، در یک پست وبلاگ نوشتند.
دوشی و پوپا اشاره میکنند که «3.8 Flash سختتر کار میکند» و با «دقت بالاتری» وظایف پیچیده مانند اجرای مراحل اضافی استدلال را انجام میدهد، هرچند گاهی ممکن است برای به حداکثر رساندن عملکرد از توکنهای بیشتری استفاده کند. این مدل دارای پنجره ورودی ۱ میلیون توکن و سقف خروجی ۶۴ هزار توکن است و میتواند متن، تصاویر، صدا، ویدیو و فایلهای PDF را پردازش کند.
3.8 Flash در بنچمارکهای متعددی که کدنویسی، قابلیتهای چندوجهی (multimodal)، استفاده از رایانه، زمینه طولانی (long-context)، کارهای دانشی و استدلال علمی را آزمایش میکنند، ارزیابی شد. گوگل میگوید که این مدل در حوزههای دانش تخصصی که نیازمند تحلیل و گزارشدهی عمیقتر هستند نیز عملکرد خوبی دارد. برای مثال، این مدل در بنچمارکهایی مانند Vals Finance Agent V2 برای مالی و Harvey's Legal Agent Benchmark برای حقوق، عملکرد بهتری نسبت به نسخه قبلی خود و سایر مدلهای پیشرو داشت؛ همچنین ۵۴.۹ درصد در Humanity’s Last Exam (HLE)-Verified کسب کرد که نشاندهنده توانایی آن در انجام وظایف استدلالی چندمرحلهای در موضوعاتی مانند ریاضی، علوم و علوم انسانی است.
در یک نمونهای که گوگل به اشتراک گذاشت، Gemini 3.8 Flash با یک پرامپت ساده و استفاده از تکنیکهای حلقهای (looping) در پلتفرم Antigravity گوگل، یک بازی ساخت. این بازی از پازلها، روایتهایی که بر اساس محیط تغییر میکنند و تصاویر و بافتهایی از Nano Banana برای ایجاد یک تجربه سهبعدی (در این مورد، یک جادوگر که در یک قلعه حرکت میکند) استفاده میکند.
در نمونههای دیگر، مدل یک نسخه کاملاً کاربردی از گوگلمپس برای سیستمعامل DOS ایجاد کرد که شامل مکانهای تعاملی، مسیرهای حرکت و نمای خیابان بود؛ یک بصریساز سهبعدی که بهطور خودکار دستگاهها را برای بازرسی به لایههای مجزا تجزیه میکرد و قابلیت اسلایدر داشت؛ و یک نقشه توپوگرافی از اماکن جغرافیایی مشهور بر اساس دادههای واقعی از اداره زمینشناسی ایالات متحده (USGS)، همراه با برشهای عرضی بلادرنگ، تصویرسازیهای دوبعدی و توضیحات علمی.
بر اساس گزارش Arena.ai، مدل 3.8 Flash در رتبه ۱۴ در Agent Arena قرار گرفت و بالاتر از DeepSeek-V4-Pro رتبهبندی شد و جهش قابلتوجهی نسبت به Gemini 3.7 Flash (که در رتبه ۳۲ قرار دارد) نشان داد. این مدل در Text Arena با رتبه ۷ معرفی شد و جلوتر از Claude Opus 5 و Gemini 3.7 Flash قرار گرفت. این نسخه در چندین حوزه نسبت به 3.7 Flash بهبود یافته است: درخواستهای چندگانه، نگارش، ادبیات و زبان، پرسشهای طولانی، پرامپتهای دشوار، کدنویسی، پیروی از دستورات، خدمات نرمافزاری و فناوری اطلاعات، و همچنین کسبوکار، مدیریت و عملیات مالی.
Flash Cyber از همین حالا در حال ایمنسازی کدهای گوگل است
Flash Cyber در ابتدا از طریق برنامه Fairwind گوگل در اختیار «مدافعان مورد اعتماد» قرار میگیرد؛ برنامهای که اولویت را با مقامات دولتی، اپراتورهای زیرساختهای حیاتی و سایر شرکایی که بهدنبال قابلیتهای پیشرفته دفاع سایبری هستند، قرار میدهد. سازمانها میتوانند برای دسترسی به این مدل درخواست دهند.
گوگل میگوید این نسخه از مدل در حوزه امنیت سایبری «آموزش دقیق» دیده است و نشاندهنده «پرش قابلتوجهی در مقاومت در برابر تزریق پرامپت (Prompt Injection)» است. این مدل بهویژه در کشف خودکار آسیبپذیریها — دستکم بر اساس بنچمارکهای داخلی Gemini — و رفع خودکار آنها (پچزنی) مهارت بالایی دارد. همچنین طبق گفته پوپا در یک ویدیو، این مدل در کدنویسی نیز بسیار توانمند است.
هدف این است که با تجهیز مدافعان به قابلیتهای سطح کارشناسی، به آنها برتری نسبت به بازیگران تهدید (چه بدخواه، چه عوامل هوش مصنوعی دیگر، چه هکرها) داده شود. دوشی و پوپا توضیح میدهند: «ما از ابتدا در رفع آسیبپذیریها سرمایهگذاری کردهایم و آن را بر قابلیتهای تهاجمی مانند بهرهبرداری (Exploitation) اولویت دادهایم.»
این مدل با مجموعهای از کنترلهای امنیتی (Mitigations) با انعطافپذیری بیشتر برای حفاظتهای سایبری عرضه میشود — به همین دلیل فعلاً فقط با شرکای محدود به اشتراک گذاشته میشود — و در برابر سوءاستفاده در حملات سایبری و حوزههایی مانند شیمیایی، بیولوژیکی، رادیولوژیکی و هستهای (CBRN) محافظت میکند.
گوگل از 3.8 Flash Cyber برای ایمنسازی کدهای خود استفاده میکند؛ این مدل ۲.۶ برابر پچهای صحیح بیشتری برای آسیبپذیریهای کروم تولید کرد، در مقایسه با مدلهای تجاری بسیار بزرگتر.
Wiz — که گوگل اوایل امسال با مبلغ تاریخی ۳۲ میلیارد دلار آن را خرید — گزارش داد که 3.8 Flash Cyber در یک بنچمارک داخلی تست نفوذ، ۷.۵ تا ۹.۷ درصد یادآوری (Recall) بالاتری از آسیبپذیریهای واقعی در دنیای واقعی داشت، در حالی که هزینه آن ۲.۳ تا ۵.۲ برابر کمتر از مدلهای پیشرو (Frontier) بود. بهطور مشابه، گروه تحقیقات آسیبپذیری ابری گوگل با استفاده از 3.8 Flash Cyber، یک آسیبپذیری حیاتی بنیادین را در کمتر از ۲ ساعت کشف کرد. گوگل ادعا میکند که معمولاً این تحقیق و کشف ماهها زمان میبرد.
پوپا گفت عوامل هوش مصنوعی در یافتن و بهرهبرداری از آسیبپذیریها «بسیار ماهر» هستند. اسکن پایگاههای کد بزرگ با مدلهای بزرگ هوش مصنوعی پرهزینه است و مدافعان تحت فشار هستند. «در امنیت سایبری، مهاجمان فقط نیاز دارند یک نقص مهم را در میان میلیونها خط کد پیدا کنند. مدافعان باید تمام آن نقصها را برطرف کنند تا بتوانند در برابر مهاجمان دفاع کنند.»
داگ ترنر، مدیر مهندسی کروم، از «فاجعه آسیبپذیری» در ماههای اخیر به دلیل هوش مصنوعی مولد (Generative AI) سخن گفت. او در یک ویدیو گفت: «فقط در یک شب، شاهد افزایشی به شکل چوبحقی (Hockey Stick) در تعداد آسیبپذیریهای نرمافزاری گزارششده از طریق برنامه تحقیقات آسیبپذیری خود بودیم.»
او توضیح داد که یکی از آسیبپذیریهای جالبی که ۳.۸ فلش سایبر کشف کرده بود، ۱۳ سال در کرومیوم و کروم وجود داشته است. این یک «باگ بسیار ظریف» بود که دهها و شاید صدها مهندس آن را بررسی کرده بودند، اما هیچگاه آن را شناسایی نکرده بودند. «ژمنی ۳.۸ فلش سایبر به ما امکان میدهد تا پیشنهادهای اصلاحی بهتری ارائه دهیم تا زندگی توسعهدهندگان بسیار آسانتر شود.»
منبع: Google’s Gemini 3.8 Flash is built for agents, while its Cyber twin hunts vulnerabilities