Bỏ qua tới nội dung chính
Quay lại tin tức

Các thẩm phán Pakistan đưa ra phán quyết về JudgeGPT

IEEE Spectrum AI· Edd Gent· 12/8/2026general

Các thẩm phán trên khắp thế giới đã gây chú ý vì sử dụng trái phép trí tuệ nhân tạo (AI) tạo sinh trong công việc của họ. Tuy nhiên, tại Pakistan, một thử nghiệm quy mô lớn về công cụ AI được thiết kế đặc biệt cho thẩm phán đã cho thấy công nghệ này – cùng với chương trình đào tạo phù hợp – giúp tăng số lượng vụ án được giải quyết lên 6,3% mà không có sự sụt giảm rõ rệt về chất lượng phán quyết. Với số lượng án tồn đọng lên tới 2,26 triệu vụ và chưa đến hai thẩm phán trên 100.000 dân – so với 22 thẩm phán ở Liên minh châu Âu (EU) và 8 thẩm phán ở Brazil – ngành tư pháp Pakistan đang rất cần sự hỗ trợ. Do đó, với sự tham vấn của ngành tư pháp, nhà kinh tế học Sultan Mehmood, thuộc Trường Kinh tế Mới ở Mosco

Các thẩm phán trên khắp thế giới đã gây chú ý vì sử dụng AI tạo sinh một cách bất hợp pháp trong công việc của họ. Tuy nhiên, tại Pakistan, một thử nghiệm quy mô lớn về công cụ AI được thiết kế đặc biệt cho các thẩm phán đã cho thấy công nghệ này – cùng với việc đào tạo phù hợp – đã giúp tăng số lượng vụ án được giải quyết lên 6,3% mà không có sự sụt giảm rõ rệt về chất lượng phán quyết. Với 2,26 triệu vụ án tồn đọng và chưa đến hai thẩm phán trên 100.000 dân – so với 22 thẩm phán ở Liên minh châu Âu và 8 thẩm phán ở Brazil – ngành tư pháp Pakistan rất cần sự hỗ trợ. Do đó, với sự tham vấn của ngành tư pháp, nhà kinh tế học Sultan Mehmood, thuộc Trường Kinh tế Mới ở Moscow, Nga, và các cộng sự đã thử nghiệm xem liệu AI có thể giảm bớt gánh nặng này hay không. Họ đã xây dựng một công cụ tùy chỉnh kết hợp mô hình ngôn ngữ lớn (LLM) GPT-4 của OpenAI với cơ sở dữ liệu gồm gần 130.000 ý kiến và luật pháp tư pháp Pakistan, nhằm hỗ trợ các thẩm phán trong việc nghiên cứu pháp lý và soạn thảo phán quyết. Họ bắt đầu cung cấp công cụ này vào năm 2024 cho 1.559 thẩm phán sơ thẩm – khoảng một nửa số thẩm phán của cả nước. Ông Mehmood cho biết: “Chúng tôi nhận thấy sự gia tăng về số lượng vụ án được giải quyết và không có sự sụt giảm tương ứng về chất lượng quyết định”. **Đầu tiên thuộc loại này** David Autor, giáo sư kinh tế tại Viện Công nghệ Massachusetts, nhận định: “Thật đáng kinh ngạc khi ông ấy có thể thực hiện được điều này”. Ông nói thêm: “Không dễ để thực hiện các thí nghiệm thực địa quy mô lớn trong dịch vụ công, đặc biệt là khi rủi ro rất cao”. Mức tăng năng suất 6,3% không phải là quá lớn, nhưng đáng tin cậy và có khả năng cải thiện khi công cụ được sử dụng rộng rãi hơn. Các công cụ AI dành cho thẩm phán đã được triển khai ở Brazil và Ấn Độ, và giáo sư luật nổi tiếng của Hoa Kỳ Eric Posner đã so sánh các phán quyết của LLM với các phán quyết của con người trong một nghiên cứu điển hình duy nhất. Tuy nhiên, cho đến nay, chưa có đánh giá độc lập lớn nào về việc sử dụng AI trong tư pháp đang diễn ra. Nghiên cứu mới tập trung vào các tòa án sơ thẩm của Pakistan; ông Mehmood cho biết các thẩm phán ở đó đã rất nhiệt tình ngay từ đầu. Ông nói: “Họ lạc quan về công nghệ hơn chúng tôi. Tình trạng chậm trễ quá lớn nên họ nghĩ rằng đây là điều đáng thử để giảm bớt sự đau khổ của người dân”. Ông Mehmood cho biết một số thẩm phán cũng đã sử dụng chatbot AI, nhưng các sản phẩm thương mại hoạt động kém hiệu quả đối với các truy vấn pháp lý của Pakistan, thường xuyên tạo ra thông tin sai lệch (hallucinating) về án lệ. Vì vậy, nhóm nghiên cứu đã xây dựng một công cụ phù hợp với bối cảnh Pakistan, được gọi là JudgeGPT. Họ đã sử dụng phương pháp tạo sinh tăng cường truy xuất (RAG), cho phép mô hình truy vấn cơ sở dữ liệu gồm 128.292 ý kiến tư pháp và 943 đạo luật của Pakistan. Các phản hồi bao gồm chú thích liên kết đến các vụ án và luật. Elliott Ash, đồng tác giả nghiên cứu, phó giáo sư luật, kinh tế và khoa học dữ liệu tại ETH Zurich ở Thụy Sĩ, cho biết: “Hóa ra cách khắc phục [tình trạng tạo thông tin sai lệch] không chỉ là các mô hình thông minh hơn. Đó là gắn các mô hình vào một công cụ có thể tìm kiếm và xác minh các nguồn”. Tuy nhiên, các nhà nghiên cứu không báo cáo tỷ lệ tạo thông tin sai lệch. Nhóm nghiên cứu cũng đã đào tạo 1.197 thẩm phán thông qua sáu buổi Zoom kéo dài 90 phút, trong đó ông Ash đã trình bày về cách thức hoạt động của LLM, những hạn chế của chúng, rủi ro về sai lệch và tạo thông tin sai lệch, cũng như tầm quan trọng của việc xác minh kết quả đầu ra. 180 thẩm phán khác chỉ được đào tạo chung về công nghệ trong nghiên cứu pháp lý, trong khi một nhóm cuối cùng không được đào tạo. Vào thời điểm 487 thẩm phán đã hoàn thành chương trình, các quận trung bình đã chứng kiến ​​số vụ án được giải quyết tăng 6,3%, và càng có nhiều thẩm phán được đào tạo trong một quận, hiệu quả càng lớn. Tỷ lệ kháng cáo cũng giảm nhẹ, cho thấy việc giải quyết nhanh hơn không dẫn đến các quyết định cẩu thả hơn. JudgeGPT có thể được sử dụng để tìm kiếm các án lệ liên quan chỉ bằng một truy vấn văn bản đơn giản và kết quả cung cấp liên kết đến toàn văn các bản án liên quan. Sultan Mehmood, Christoph Goessmann và Elliott Ash. **Giải quyết các hạn chế** Nhóm nghiên cứu cũng đánh giá chất lượng các bản án. Ông Mehmood cho biết, việc yêu cầu các chuyên gia pháp lý đánh giá số lượng lớn bản án là không khả thi. Do đó, nhóm đã yêu cầu GPT-5-mini của OpenAI lựa chọn giữa các cặp bản án của cùng một thẩm phán trước và sau khi huấn luyện. Mô hình LLM đã chọn các bản án sau huấn luyện trong 59% trường hợp. Hai luật sư Pakistan giàu kinh nghiệm cũng đánh giá phân tích của mô hình đối với 90 cặp bản án. Họ đồng ý với GPT-5-mini trong 70,6% trường hợp, so với tỷ lệ đồng thuận 73% giữa hai luật sư. Việc huấn luyện đã chứng tỏ vai trò quan trọng. Trung bình, các thẩm phán được huấn luyện JudgeGPT đã đăng nhập 56 lần và gửi 212 lời nhắc (prompt) trong suốt thời gian nghiên cứu, so với 10 lần đăng nhập và 25 lời nhắc sau khi được huấn luyện chung. Ông Mehmood cho biết, những người không được huấn luyện có xu hướng sử dụng công cụ này khoảng một tháng rồi bỏ hẳn. Ông nói: “Việc chỉ cung cấp công nghệ cho mọi người không nhất thiết khiến họ sử dụng nó một cách bền bỉ”. Mức tăng 6,3% nghe có vẻ khiêm tốn, nhưng các nhà nghiên cứu tính toán rằng một thẩm phán được huấn luyện đã giải quyết thêm 38,5 vụ án mỗi tháng so với mức cơ bản, tương đương với việc tiết kiệm khoảng 38,50 USD chi phí tư pháp cho mỗi đô la chi phí vận hành công cụ. Ông Ash cũng lưu ý rằng những số liệu này đến từ giai đoạn chín tháng đầu thử nghiệm, và kể từ đó họ đã cập nhật cả mô hình AI cơ bản lẫn cơ sở dữ liệu. Đối với người dùng, công cụ này là một cứu cánh. Một thẩm phán tham gia thử nghiệm, người yêu cầu giấu tên, cho biết số lượng vụ án được giao cho họ chưa bao giờ giảm xuống dưới 1.000 trong hơn một thập kỷ qua. Công cụ này giúp tiết kiệm đáng kể thời gian, đặc biệt là trong việc tìm kiếm án lệ và tóm tắt các tài liệu dài. Vị thẩm phán này cho biết: “Để nghiên cứu, chỉ cần một lời nhắc, trong khi trước đây tôi phải mất hàng giờ để tìm kiếm các tiền lệ và luật pháp. Nếu tôi phải đọc 10 trang của một tiền lệ, bây giờ tôi yêu cầu JudgeGPT tóm tắt cho tôi và đưa ra điểm cốt lõi, và nó thực hiện công việc đó trong vài giây”. Tuy nhiên, hiệu quả không phải là điều duy nhất mong muốn ở một hệ thống tư pháp, theo John Zeleznikow, giáo sư luật và công nghệ tại Đại học La Trobe ở Úc. Ông nói: “Những gì họ đã cố gắng làm là hiệu quả, [để] giải quyết nhiều vụ án hơn một cách nhanh chóng, và họ có thể làm được điều đó. Điều chưa rõ ràng là liệu cái mà bạn gọi là chất lượng công lý có tốt hơn hay không”.

Nguồn tin: IEEE Spectrum AI — Tác giả: Edd Gent. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.