Майкрософт‑дослідники стверджують, що моделі ШІ ще не здатні вирішувати складні завдання.

Майкрософт‑дослідники стверджують, що моделі ШІ ще не здатні вирішувати складні завдання.

18 hardware

Microsoft‑дослідники виявили обмеження сучасних великих мовних моделей (LLM) при виконанні складних багатократних завдань

У рамках експериментів Microsoft Research з’ясували, що навіть найпотужніші моделі ШІ роблять серйозні помилки, коли їм доручають виконувати тривалі та багатоетапні операції. Серед протестованих систем — Gemini 3.1 Pro, Claude 4.6 Opus і GPT 5.4 — у середньому кожна втративала близько 25 % змісту документів після автономної обробки.

Що саме тестували
* Бенчмарк DELEGATE‑52

Створений командою Філіпа Лабана, Тобіаса Шнабеля та Дженніфер Невілл. Він моделює робочі процеси у 52 професійних галузях: від програмування і нотної запису до кристаллографії.

* Критерій оцінки

Моделі оцінювалися за тим, наскільки вони зберігають цілісність документа після 20 циклів обробки. Поріг «готовності» був встановлений на рівні 98 % – якщо результат падала нижче, задача вважалася невдалою.

Основні висновки
Область | Найкращі результати | Програмування | Найсильніші показники | Естественний мова | Наименее надёжные модели
---|---|---|---|---|---
* Зниження якості

У більш ніж 80 % комбінацій документів якість впала до 80 % і нижче. Найкраща модель (Gemini 3.1 Pro) задовольняла критеріям готовності лише в 11 з 52 областей.

* Скачкові помилки

Втрати не відбувалися поступово, а «скачками»: за один цикл взаємодії модель могла втратити від 10 до 30 % точності. Більш просунуті моделі (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) намагалися уникати дрібних помилок, відкладуючи їх обробку на пізніші етапи і скорочуючи кількість взаємодій.

* Агентське управління

При використанні інструментів у режимі агентського управління результати не покращувалися: до кінця циклу якість падала приблизно на 6 %.

Що це означає для користувачів
Вчені підкреслюють, що користувачам все ще необхідно уважно контролювати роботу систем ШІ при делегуванні їм повноважень. Поточні моделі здатні працювати автономно лише в вузьких сферах.

Незважаючи на це, автори бенчмарку відзначають помітний прогрес: сімейство моделей OpenAI за 16 місяців покращило показники продуктивності з 14,7 % до 71,5 %. Це підтверджує, що LLM продовжують розвиватися, але наразі залишаються обмеженими у складних багатократних задачах.

Коментарі (0)

Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.

Поки немає коментарів. Залиште коментар — поділіться своєю думкою!

Щоб залишити коментар, увійдіть в акаунт.

Увійдіть, щоб коментувати