Nhà khoa học trưởng của OpenAI phản hồi về tranh cãi xung quanh "suy luận AI thiếu minh bạch"

Vũ Nguyễn
Vũ Nguyễn
Phản hồi: 0
Nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã phản hồi hôm qua (ngày 2 tháng 9) về tranh cãi xung quanh "lý luận không thể giám sát/mờ ám" của mô hình AI Astra thông qua một tweet trên nền tảng X.

Pachoki nhấn mạnh rằng các mô hình tiên tiến, bao gồm cả Astra, có độ sâu đồ thị tính toán không quá gấp đôi so với GPT-4, và kiến trúc của chúng không có bước nhảy vọt về độ phức tạp. OpenAI tuyên bố sẽ triển khai thêm hệ thống giám sát chuỗi suy nghĩ cho Astra, và việc tăng cường giám sát vẫn là mục tiêu nghiên cứu cốt lõi.

Vụ việc bắt nguồn từ một báo cáo chuyên sâu của The Information, tiết lộ rằng OpenAI đang thử nghiệm công nghệ "độ sâu lặp lại", điều này có thể khiến các nhà nghiên cứu khó giải thích hơn quá trình suy luận "chuỗi tư duy" của các mô hình.

Về mặt kỹ thuật, hầu hết các mô hình chính thống, bao gồm ChatGPT, Claude và Gemini, đều dựa trên kiến trúc Transformer. Các mô hình này thường xử lý thông tin theo các bước tuyến tính và có thể xuất ra quá trình suy luận bằng ngôn ngữ tự nhiên trong một số trường hợp, nhưng chúng có thể không phản ánh chính xác quá trình tính toán bên trong của mô hình.

Ngược lại, "vòng lặp sâu" cho phép mô hình liên tục gọi cùng một tập hợp các lớp mạng, liên tục cập nhật các biểu diễn nội bộ của nó. So với các cấu trúc tuyến tính truyền thống, cách tiếp cận này có thể để lại nhiều suy luận thực sự của mô hình trong các trạng thái nội bộ khó đọc trực tiếp. Bài báo gốc lập luận rằng điều này khiến các nhà nghiên cứu khó theo dõi con đường ra quyết định của mô hình bằng cách sử dụng chuỗi suy nghĩ.

Sau khi báo cáo chuyên sâu này được công bố, nó nhanh chóng trở thành chủ đề nóng trong cộng đồng AI, với nhiều người cho rằng việc triển khai công nghệ này sẽ khiến các công cụ giám sát bên ngoài khó hiểu hơn cách các mô hình AI đưa ra kết luận của chúng, do đó làm giảm "tính minh bạch" của các mô hình.

Hôm qua, nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã phản hồi về vụ tranh cãi bằng một dòng tweet trên nền tảng X. Sau đây là bản dịch:
1788422602070.png
Tôi hy vọng tuyên bố này sẽ ngăn chặn một cuộc chạy đua hướng tới các quốc gia không được kiểm soát trong lĩnh vực trí tuệ nhân tạo do sự đưa tin hỗn loạn của giới truyền thông gây ra. Độ sâu đồ thị tính toán của các mô hình hiện đại nhất hiện nay (bao gồm cả Astra) ít hơn gấp đôi so với GPT-4 (kiến trúc mô hình chưa trải qua bước nhảy vọt về độ phức tạp mà một số người lo ngại).

Kể từ khi mô hình suy luận ban đầu ra đời, OpenAI đã nỗ lực duy trì và sử dụng kỹ thuật giám sát chuỗi suy nghĩ. Chúng tôi đánh giá cao kỹ thuật này vì nó cho phép chúng tôi hiểu được cách thức sự phù hợp của mô hình được khái quát hóa từ phân bố dữ liệu huấn luyện.

Tôi tin rằng hiện tại nó khá mong manh, và không may là nó đang đi theo chiều hướng tiêu cực vì một số lý do không liên quan đến những thay đổi về kiến trúc (mà tôi sẽ trình bày chi tiết hơn sau). Tuy nhiên, có những bước chúng ta có thể thực hiện để củng cố nó, đây là một trong những mục tiêu cốt lõi của dự án nghiên cứu hiện tại của chúng tôi.
Độ sâu đồ thị tính toán là một chỉ số cốt lõi để đo lường độ phức tạp kiến trúc của mô hình mạng nơ-ron. Nó đề cập đến số lượng các lớp tính toán cần được thực thi tuần tự từ đầu vào đến đầu ra trong mô hình. Giá trị càng cao, mô hình càng có nhiều lớp tính toán và cấu trúc càng phức tạp.
 
Back
Top