ЧатГПТ, Gemini та Claude розподіляють оцінки зникнення професій через ШІ, а науковці сумніваються у їхній достовірності

ЧатГПТ, Gemini та Claude розподіляють оцінки зникнення професій через ШІ, а науковці сумніваються у їхній достовірності

26 software

Ключова ідея дослідження

Економісти із Північно-Західного університету та Американського університету виявили, що три найбільші мовні ІІ-моделі (ChatGPT‑5, Gemini 2.5 і Claude 4.5) дають різну оцінку тому, які професії перебувають у зоні ризику автоматизації. Це ставить під сумнів надійність «індексів схильності до ІІ» – числових показників, що використовують політики та роботодавці при плануванні майбутнього ринку праці.

1. Як проводилося дослідження
Крок | Що робили
Постановка задачі | Попросили моделі оцінити вразливість різних професій перед ІІ.
Сравнение відповідей | Сопоставляли оцінки між собою і з реальними даними.
Аналіз причин розбіжностей | Виявили два ключові фактори: відмінності у самих моделях та вплив того, які спеціалісти вже використовують ІІ.

2. Результати
Професія | Claude 4.5 | Gemini 2.5 | ChatGPT‑5
Бухгалтер | Висока вразливість | Низька | Середня
Рекламний менеджер | — | — | —
Руководитель високого рівня | — | — | —

* Розбіжності
- Claude ставив бухгалтера у топ, Gemini – значно нижче.
- Оцінки рекламних менеджерів і топ‑менеджерів також різнилися.
- ChatGPT та Gemini збігли майже в 75 % випадків, але розійшлися приблизно в четверті.

* Вплив «користувачів ІІ»
Фінансові аналітики активно працюють з нейронними мережами, створюючи дані, на яких навчаються майбутні моделі. Це зміщує оцінки і робить професії, вже тісно пов’язані з ІІ, більш вразливими у погляді моделей.

3. Як будуються індекси схильності
1. Вручну – експерти оцінюють вплив ІІ на конкретні завдання.
2. Опитування користувачів – збирають думки тих, хто вже застосовує платформу.
3. Найбільші мовні моделі (LLM) – генерують оцінки автоматично.

* Проблеми:
- Вручну піддаються суб’єктивності.
- Опитування обмежуються однією платформою і не відображають весь ринок.

Незважаючи на це, такі індекси широко застосовуються в аналітичних звітах, консалтингу та політиці.

4. Що означає це для практики
* Надійність оцінок – поки невідома, чи точніше LLM дають прогнози порівняно з експертними методами.
* Ризик прийняття рішень на основі одного показника – автори попереджають, що політики та роботодавці можуть помилково покладатися на однозначні цифри.

5. Рекомендації дослідників
1. Використовувати кілька ІІ‑моделей одночасно, а не одну.
2. Явно вказувати рівень невизначеності у результатах.
3. Підтверджувати висновки опитуваннями реальних користувачів, щоб зрозуміти, як ІІ дійсно впроваджується і які завдання виконує.

> «Особисто я не брав би надію на один показник для вирішення питань зміни роботи або вибору спеціальності», – зазначає Мішель Інь.

Висновок:
Поточні індекси схильності до ІІ потребують більш критичного підходу. Поєднання кількох моделей і емпіричних даних допоможе зробити прогнози надійнішими та уникнути неправильних рішень, основаних на односторонніх оцінках.

Коментарі (0)

Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.

Поки немає коментарів. Залиште коментар — поділіться своєю думкою!

Щоб залишити коментар, увійдіть в акаунт.

Увійдіть, щоб коментувати