Штучні інтелектуальні роботи знищують ефективність у довгих розмовах із людьми — велике дослідження Microsoft підтвердило це.
Дослідження Microsoft Research і Salesforce: як великі ІІ‑моделі втрачають орієнтацію у діалогах
Що досліджували
Які моделі 200 000+ багатоступеневих розмов з провідними LLM GPT‑4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, OpenAI o3, DeepSeek R1, Llama 4
Ключові висновки
Показник Результат
Точність при одиночних запитах 90 % коректних відповідей (GPT‑4.1, Gemini 2.5 Pro)
Точність у довгих діалогах ~65 % – майже на третю падає ефективність
Поведінка моделі Часто «переписує» свій перший неправильний відповідь як основу для наступних реплік
Довжина відповідей Зростає на 20‑300 % у багатоступеневих бесідах, що призводить до зростання галюцинацій і припущень
Надійність Знижується до 112 % (моделі «завчасно» генерують відповідь, не дочитавши запит)
Чому так відбувається?
1. Переписування неправильної основи
Модель тримається за свій перший висновок і будує наступні відповіді на ньому, навіть якщо він помилковий.
2. Роздування контексту
При кожному новому питанні додається більше тексту – це збільшує кількість «пригаданих» фактів, які модель сприймає як факти.
3. Проблема з токенами мислення
Навіть моделі з додатковими “токенами” (o3, DeepSeek R1) не змогли подолати цю пастку – вони все одно генерують відповіді занадто рано і без достатнього аналізу.
Що це означає для користувачів?
- Низька надійність у реальних бесідах
ІІ може «втратити» тему, почавши говорити про неіснуючі речі.
- Ризик неправильної інформації
Відмова від традиційних пошукових систем в користь генеративних інструментів (наприклад, Google‑ІІ‑огляди) підвищує ймовірність отримання недостовірних даних.
- Важливість якісних підказок
Microsoft раніше зазначала низький рівень інженерії при створенні запитів. Невдалі питання і «погані» підказки можуть стати причиною того, що ІІ не розкриває свій потенціал.
Висновок
Технологія великих мовних моделей ще знаходиться на стадії розвитку. Хоча вони демонструють високу точність при одиночних запитах, їхна надійність у багатоступеневих діалогах залишається проблемою. Для безпечного і ефективного використання ІІ важливо:
1. Писати чіткі, конкретні питання.
2. Бути готовими коригувати відповіді моделі.
3. Не покладатися повністю на генеративний контент без перевірки фактів.
У кінцевому рахунку, удосконалення моделей і підвищення їхньої стійкості у тривалих бесідах – ключ до того, щоб ІІ став надійним партнером для користувачів.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати