Назад
SiTech Team⏱️ 5 წთ. საკითხავი

Система ШІ допомогла пакистанським суддям розчистити завали справ із прибутком $38.50 на кожен вкладений долар

Система ШІ допомогла пакистанським суддям розчистити завали справ із прибутком $38.50 на кожен вкладений долар

Дослідження ETH Zurich та Imperial College London показало, що система ШІ на базі GPT-4 допомогла пакистанським суддям досягти 6,3% зростання у вирішенні справ.

Криза судової системи Пакистану

Судова система Пакистану є однією з найбільш перевантажених у світі. На кінець 2024 року 2,26 мільйона справ залишалися невирішеними, з яких 82% застрягли в судах першої інстанції. У країні менше 2 суддів на 100 000 мешканців — для порівняння, у ЄС цей показник становить 22, а в Англії — 30. Ця криза означає, що мільйони людей роками чекають на справедливість, що створює не лише соціальну, а й економічну проблему. Нерозв'язані справи гальмують бізнес-активність, відлякують інвестиції та підривають довіру громадськості до державних інституцій.

Створення JudgeGPT: ШІ-система для судів

Дослідники з ETH Zurich та Imperial College London створили «JudgeGPT» на основі GPT-4 від OpenAI, використовуючи технологію Retrieval-Augmented Generation (RAG). RAG фундаментально змінює підхід до роботи ШІ у спеціалізованих галузях — замість покладання виключно на навчальні дані, модель активно отримує релевантну інформацію з довіреної бази даних у реальному часі. Система базувалася на 129 235 документах, включаючи 128 292 судових рішень та 943 пакистанських законів. Це означало, що суддя міг ввести конкретні обставини справи та отримати відповідь, засновану на актуальному законодавстві та прецедентах.

Найбільше рандомізоване дослідження ШІ в уряді

Це було наймасштабніше експериментальне дослідження впливу ШІ на продуктивність уряду. 1559 суддів зі 118 судів було поділено на три групи: (1) JudgeGPT із цільовим навчанням, (2) JudgeGPT із загальним семінаром та (3) контрольна група без доступу до ШІ. Це рандомізоване контрольоване дослідження (РКД) тривало 40 тижнів. Дослідники відстежували не лише частоту використання ШІ суддями, але й якість рішень, рівень апеляцій, робочі години та потенційні ознаки упередженості.

Навчання — вирішальний фактор

Найбільш вражаючим відкриттям стало те, що сам по собі доступ до ШІ (лише із загальним семінаром) майже нічого не давав. Це особливо показово, враховуючи, що лише близько 25% учасників колись користувалися LLM, як-от ChatGPT — це свідчить про те, що незнайомість була серйозним бар'єром. Судді, які пройшли цільове навчання, використовували ШІ в 4 рази частіше: після 40 тижнів вони мали близько 60 сесій із понад 200 запитами, порівняно з приблизно 20 сесіями та менш ніж 50 запитами в групі загального семінару. Цільове навчання включало практичні вправи, імітовані розгляди справ та індивідуальний зворотний зв'язок.

Значне підвищення продуктивності

Результати були суттєвими: 1848 додаткових вирішених справ на рік на кожен район, що становить 6,3% приросту. Цей відсоток може здатися скромним, але в абсолютних показниках це означає тисячі додаткових вирішених справ по всій системі. Рівень апеляцій фактично дещо знизився на кожні 1000 вирішених справ, що вказує на те, що рішення, прийняті за допомогою ШІ, не були нижчої якості — радше навпаки. Коли незалежні юридичні експерти оцінювали рішення суддів у сліпих парних порівняннях, рішення, створені за допомогою ШІ, отримували вищу оцінку у 59% випадків порівняно з 42% у контрольній групі.

Етика, упередженість та баланс роботи й життя

Важливо, що робочі години та баланс між роботою та особистим життям не змінилися — ШІ зробив роботу ефективнішою, а не довшою. Дослідження не виявило доказів посилення гендерної чи релігійної упередженості у рішеннях, прийнятих за допомогою ШІ. Це свідчить про те, що при належному проєктуванні та моніторингу ШІ може зменшувати людську упередженість, а не посилювати її.

Безпрецедентна економічна віддача

ROI у розмірі $38.50 на кожен вкладений долар є безпрецедентним для державних технологічних ініціатив. Навіть консервативна оцінка перевищує $10 на долар. Дослідники зазначають, що ці результати були досягнуті з використанням версії GPT-4 «pre-reasoning», тобто сучасні моделі міркування, як-от GPT-4o, Claude 4 або Gemini 2.5, ймовірно, дали б ще вищі показники. Розрахунки витрат включали використання API, витрати на навчання, інфраструктуру та час суддів.

Виклики та ризики

Незважаючи на успіх, дослідження виявило кілька важливих проблем. Інфраструктура: у багатьох судах доступ до Інтернету був обмежений, що ускладнювало використання ШІ. Вартість навчання: цільове навчання потребує часу та ресурсів, хоча ROI виправдовує ці інвестиції. Упередженість моделі: GPT-4 переважно навчається на західних даних, що потенційно може створювати суперечності з ісламською правовою системою Пакистану. Дослідники ретельно контролювали це і не виявили значних проблем, але це залишається важливим фактором для будь-якої іншої юрисдикції.

Уроки для Грузії та Південного Кавказу

Судова система Грузії стикається з подібними викликами: накопичення справ, обмежені людські ресурси та повільні процеси. Хоча масштаби відрізняються від пакистанських, основні уроки є універсальними.

1. ШІ без навчання не працює. Дослідження JudgeGPT чітко показало, що доступ до технологій без знань є марним. Грузії потрібна структурована програма навчання для суддів у межах будь-якого впровадження ШІ.

2. Інфраструктура юридичних даних є основоположною. Система на основі RAG потребує високоякісних, оцифрованих юридичних баз даних. Законодавчий вісник Грузії (matsne.gov.ge) вже містить оцифроване законодавство — міцна основа для подібної ініціативи.

3. Потенціал ROI є трансформаційним. $38.50 на долар інвестицій свідчить про те, що ШІ у правосудді є економічно дуже вигідним. Навіть пілотний проєкт вартістю $100 000 може принести мільйони ларі економічної вигоди.

4. Прозорість і людський контроль. Забезпечення того, щоб рішення ШІ не були «чорною скринькою», є критично важливим. Залучення суддів до редагування та остаточного затвердження створеного ШІ контенту зберігає людський контроль і підзвітність.

Вища рада юстиції Грузії та програми судової реформи могли б використати ці висновки для розробки пілотних проєктів ШІ у грузинських судах. Вірменія та Азербайджан також стикаються з подібними судовими викликами — весь регіон Південного Кавказу може скористатися уроками пакистанського експерименту.

Висновок

Дослідження JudgeGPT є поворотним моментом для використання ШІ в уряді. Воно надає перші масштабні експериментальні докази того, що ШІ може значно підвищити продуктивність уряду та покращити якість послуг для громадян. Ключові інгредієнти — навчання, інфраструктура та якість даних — є універсальними. Якщо Пакистан із його 2,26 мільйона нерозглянутих справ зміг досягти значного прогресу за допомогою ШІ з прибутком $38.50 на кожен вкладений долар, чому б іншим країнам — включаючи Грузію — не спробувати? Майбутнє правосуддя вже тут; це залежить від нас, як його використати.