ChatGPT, суперзірка штучного інтелекту, зіткнувся з питанням, оскільки він продовжує рухатися вперед: чи відповідає він стандарту тесту Тьюрінга для генерації результатів, які неможливо відрізнити від відповідей людини? Останні дослідження показують, що ChatGPT, незважаючи на його чудову продуктивність, здається, не повністю перетнув цей поріг.
Двоє дослідників з Каліфорнійського університету в Сан-Дієго, Камерон Джонс, експерт з мови, семантики та машинного навчання, і Бенджамін Берген, професор когнітивної науки, поставили це питання, посилаючись на роботу Тюрінга 70 років тому. Тьюрінг запропонував процес визначення того, чи здатна машина досягти рівня інтелекту та розмовних здібностей, достатнього для того, щоб змусити інших подумати, що це людина.
Їхній звіт називається «Чи проходить GPT-4 тест Тьюринга?» Його можна знайти на сервері препринтів arXiv. Для дослідження вони зібрали 650 учасників, щоб зіграти в 1400 «ігор», у яких учасники мали коротку розмову з іншою людиною або моделлю GPT і просили визначити, з ким вони розмовляють.
Те, що виявили дослідники, було дивовижним. Модель GPT-4 обманювала учасників у 41 відсотку випадків, а GPT-3.5 — лише у 5–14 відсотках випадків. Цікаво, що людям вдалося переконати учасників, що вони не машини, лише в 63 відсотках випробувань.
«Ми не знайшли жодних доказів того, що GPT-4 пройшов тест Тьюринга», — підсумували дослідники. Однак вони відзначають, що тест Тьюринга все ще має значення для оцінки ефектів машинних розмов, як основи для вимірювання плавної соціальної взаємодії та обману, а також для розуміння людських стратегій адаптації до цих пристроїв.
Однак вони також попереджають, що в багатьох випадках чат-боти все одно зможуть переконливо спілкуватися. «41 відсоток успіху свідчить про те, що моделі штучного інтелекту вже можуть вводити в оману, особливо в ситуаціях, коли люди менш уважні до можливості того, що вони можуть не розмовляти з людиною», — зазначають дослідники. Моделі ШІ, які надійно імітують людей, можуть мати широкі соціальні та економічні наслідки».
Дослідники помітили, що учасники, які правильно ідентифікували ШІ з людьми, зосереджувалися на кількох факторах. Надто офіційна або неформальна модель викликає підозри. Якщо їхнє вираження занадто багатослівне або занадто стисле, якщо їхня граматика чи пунктуація надзвичайно хороші чи «непереконливо» погані, це також буде ключовим фактором у визначенні того, чи учасники взаємодіють з людьми чи машинами. Крім того, учасники були чутливі до відповідей, які звучали надто загально.
Дослідники припускають, що відстеження моделей штучного інтелекту ставатиме все більш важливим, оскільки вони стануть більш плавними та поглинатимуть більше людських примх. "Виявлення факторів, які призводять до обману, і стратегії його пом'якшення ставатимуть все більш важливими", - сказали вони. Дослідження показує, що сфера інтелектуальних розмов все ще стикається з проблемами, але також дає корисну інформацію про те, як можна вдосконалити моделі ШІ.
