ЧатГПТ, Gemini та Claude розподіляють оцінки зникнення професій через ШІ, а науковці сумніваються у їхній достовірності
Ключова ідея дослідження
Економісти із Північно-Західного університету та Американського університету виявили, що три найбільші мовні ІІ-моделі (ChatGPT‑5, Gemini 2.5 і Claude 4.5) дають різну оцінку тому, які професії перебувають у зоні ризику автоматизації. Це ставить під сумнів надійність «індексів схильності до ІІ» – числових показників, що використовують політики та роботодавці при плануванні майбутнього ринку праці.
1. Як проводилося дослідження
Крок | Що робили
Постановка задачі | Попросили моделі оцінити вразливість різних професій перед ІІ.
Сравнение відповідей | Сопоставляли оцінки між собою і з реальними даними.
Аналіз причин розбіжностей | Виявили два ключові фактори: відмінності у самих моделях та вплив того, які спеціалісти вже використовують ІІ.
2. Результати
Професія | Claude 4.5 | Gemini 2.5 | ChatGPT‑5
Бухгалтер | Висока вразливість | Низька | Середня
Рекламний менеджер | — | — | —
Руководитель високого рівня | — | — | —
* Розбіжності
- Claude ставив бухгалтера у топ, Gemini – значно нижче.
- Оцінки рекламних менеджерів і топ‑менеджерів також різнилися.
- ChatGPT та Gemini збігли майже в 75 % випадків, але розійшлися приблизно в четверті.
* Вплив «користувачів ІІ»
Фінансові аналітики активно працюють з нейронними мережами, створюючи дані, на яких навчаються майбутні моделі. Це зміщує оцінки і робить професії, вже тісно пов’язані з ІІ, більш вразливими у погляді моделей.
3. Як будуються індекси схильності
1. Вручну – експерти оцінюють вплив ІІ на конкретні завдання.
2. Опитування користувачів – збирають думки тих, хто вже застосовує платформу.
3. Найбільші мовні моделі (LLM) – генерують оцінки автоматично.
* Проблеми:
- Вручну піддаються суб’єктивності.
- Опитування обмежуються однією платформою і не відображають весь ринок.
Незважаючи на це, такі індекси широко застосовуються в аналітичних звітах, консалтингу та політиці.
4. Що означає це для практики
* Надійність оцінок – поки невідома, чи точніше LLM дають прогнози порівняно з експертними методами.
* Ризик прийняття рішень на основі одного показника – автори попереджають, що політики та роботодавці можуть помилково покладатися на однозначні цифри.
5. Рекомендації дослідників
1. Використовувати кілька ІІ‑моделей одночасно, а не одну.
2. Явно вказувати рівень невизначеності у результатах.
3. Підтверджувати висновки опитуваннями реальних користувачів, щоб зрозуміти, як ІІ дійсно впроваджується і які завдання виконує.
> «Особисто я не брав би надію на один показник для вирішення питань зміни роботи або вибору спеціальності», – зазначає Мішель Інь.
Висновок:
Поточні індекси схильності до ІІ потребують більш критичного підходу. Поєднання кількох моделей і емпіричних даних допоможе зробити прогнози надійнішими та уникнути неправильних рішень, основаних на односторонніх оцінках.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати