Клауд Міфос підтверджено тестами як лідер з виявлення вразливостей, однак він демонструє й інші недоліки
Коротка змістовність
Компанія XBOW провела незалежну оцінку ІІ‑моделі Mythos Preview від Anthropic. Результати показали, що модель перевершує існуючі аналогічні моделі у пошуку вразливостей вихідного коду та при роботі з нативним кодом і реверс‑інжинірингом, але проявляє слабкості в аналізі ізольованого коду й підтвердженні практичної застосовності знайдених експлойтів. Вартість роботи моделі залишається питанням: Mythos дорожча за Opus, проте при обмеженому бюджеті токенів вона іноді демонструє кращу точність.
1. Що перевіряла XBOW
- Обсяг тестів – серія незалежних експериментів над Mythos Preview.
- Сценарії – аудит працюючих систем із доступом до вихідного коду, аналіз ізольованого коду, реверс‑інжиніринг і взаємодія з графічним інтерфейсом.
2. Ключові висновки
Показник Mythos Preview протилежні моделі
Виявлення вразливостей – найкращий показник серед усіх моделей, особливо у вихідному коді й нативному програмуванні. Менш точна, але іноді більш надійна при перевірці конкретних випадків.
Сів відфальшивих спрацьовувань – видаляє більше «помилкових» знахідок, ніж попередники. Часто видає більше фальшивих тривог.
Проблеми в ізольованому коді – модель гірше справляється без контексту системи. Деякі моделі краще працюють з построчним аналізом.
Підтвердження експлойтів – схильна до буквального підходу, іноді переоцінює практичну цінність знахідок. Більш критична щодо реальної застосовності.
Реверс‑інжиніринг і нативний код – видає сильні результати; добре «розуміє» логіку програми без вихідного коду. Менш точна в цих завданнях.
Взаємодія з UI – не завжди точно знаходить координати елементів, але успішно визначає потрібні дії у браузері. Деякі моделі більш точні в позиціонуванні.
3. Вартість і ефективність
- Ценообразування – Anthropic заявила, що Mythos буде коштувати в п’ять разів більше Opus.
- Економічний аналіз – XBOW провела експерименти з «дешевими» моделями, надавши їм більше часу роботи. Результати показали, що при нормалізації за вартою робота Mythos Preview не виглядає розтратливою для завдань високої точності.
- Бенчмарки – При фіксованому бюджеті токенів Mythos перевершує Opus 4.6 у пошуку веб‑вразливостей, але уступає GPT5.5.
4. Підсумок
Mythos Preview демонструє видатну потужність при аудиту вихідного коду й нативних програм, а також у завданнях реверс‑інжинірингу і аналізу веб‑приложень. Однак модель іноді недооцінює реальну застосовність знайдених вразливостей і проявляє слабкості в ізольованому аналізі коду. При обмежених ресурсах токенів Mythos може бути більш вигідною, ніж Opus, але при повному бюджеті GPT5.5 залишається конкурентом.
Висновок XBOW: Mythos Preview – надійний інструмент для виявлення потенційних вразливостей у вихідному коді й складних системах, але потребує додаткового підтвердження практичної цінності знайдених експлойтів.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати