Майкрософт‑дослідники стверджують, що моделі ШІ ще не здатні вирішувати складні завдання.
Microsoft‑дослідники виявили обмеження сучасних великих мовних моделей (LLM) при виконанні складних багатократних завдань
У рамках експериментів Microsoft Research з’ясували, що навіть найпотужніші моделі ШІ роблять серйозні помилки, коли їм доручають виконувати тривалі та багатоетапні операції. Серед протестованих систем — Gemini 3.1 Pro, Claude 4.6 Opus і GPT 5.4 — у середньому кожна втративала близько 25 % змісту документів після автономної обробки.
Що саме тестували
* Бенчмарк DELEGATE‑52
Створений командою Філіпа Лабана, Тобіаса Шнабеля та Дженніфер Невілл. Він моделює робочі процеси у 52 професійних галузях: від програмування і нотної запису до кристаллографії.
* Критерій оцінки
Моделі оцінювалися за тим, наскільки вони зберігають цілісність документа після 20 циклів обробки. Поріг «готовності» був встановлений на рівні 98 % – якщо результат падала нижче, задача вважалася невдалою.
Основні висновки
Область | Найкращі результати | Програмування | Найсильніші показники | Естественний мова | Наименее надёжные модели
---|---|---|---|---|---
* Зниження якості
У більш ніж 80 % комбінацій документів якість впала до 80 % і нижче. Найкраща модель (Gemini 3.1 Pro) задовольняла критеріям готовності лише в 11 з 52 областей.
* Скачкові помилки
Втрати не відбувалися поступово, а «скачками»: за один цикл взаємодії модель могла втратити від 10 до 30 % точності. Більш просунуті моделі (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) намагалися уникати дрібних помилок, відкладуючи їх обробку на пізніші етапи і скорочуючи кількість взаємодій.
* Агентське управління
При використанні інструментів у режимі агентського управління результати не покращувалися: до кінця циклу якість падала приблизно на 6 %.
Що це означає для користувачів
Вчені підкреслюють, що користувачам все ще необхідно уважно контролювати роботу систем ШІ при делегуванні їм повноважень. Поточні моделі здатні працювати автономно лише в вузьких сферах.
Незважаючи на це, автори бенчмарку відзначають помітний прогрес: сімейство моделей OpenAI за 16 місяців покращило показники продуктивності з 14,7 % до 71,5 %. Це підтверджує, що LLM продовжують розвиватися, але наразі залишаються обмеженими у складних багатократних задачах.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати