Thoại Viết Hoàng✔
Writer
Cánh tay robot cầm cọ, nhúng sơn, rồi vẽ Cầu Cổng Vàng. Mỗi lần vẽ, nó lại vẽ tốt hơn lần trước.
Đó là thử nghiệm của các sinh viên Stanford với GPT-6 Astra, mô hình OpenAI vừa phát hành. Họ gắn cho nó một cánh tay robot, một cây cọ và một chiếc camera. Astra nhìn hình ảnh từ camera và tự tìm cách điều khiển cánh tay. Video dài một phút này vượt 2 triệu lượt xem trên X, và Sam Altman cũng trả lời rằng ông muốn có một cái.

Những ngày qua, nhiều người khác cũng thử Astra ở nhiều việc khác nhau. Có người bảo nó dựng mô hình 3D trong Blender. Có người giao cho nó đi tìm kim cương trong Minecraft. Có người cho nó vẽ chân dung. Điểm chung là "computer use", tức khả năng tự vận hành máy tính như một người thật, và đây đang là chủ đề được bàn nhiều nhất.
Một blogger chưa từng dùng Blender đã yêu cầu Astra làm một chiếc tàu con thoi. Khoảng mười phút sau, mô hình hiện ra, xoay và phóng to được. Anh mô tả trải nghiệm này "giống như phép thuật". Nghệ sĩ 3D người Nhật Hirokazu Yokohara thì đưa cho Astra một hình tham khảo, và nó tự mở Blender, làm gần hết công việc. Ông nhận xét mức hoàn thiện chưa hoàn hảo, nhưng đây là lần đầu ông cảm thấy kỷ nguyên đồ họa 3D không còn làm thủ công đã bắt đầu.
Một người dùng giao nhiệm vụ đào kim cương trong Minecraft trước khi đi ngủ. Sáng dậy, anh thấy trong ba lô đã có một viên. Việc này vốn khó, vì phải đi đào, tránh quái vật và tự dựng cả chuỗi công cụ trước.

Vậy vì sao Astra làm được? Kỹ sư Kyle Jeong của Browserbase đã đọc mã nguồn Codex mã nguồn mở của OpenAI để tìm câu trả lời.
Các giải pháp trước đây, từ Computer Use của Anthropic đến Operator của OpenAI, đều theo cách chụp màn hình rồi bấm vào tọa độ pixel. Cách này có điểm yếu: đổi độ phân giải màn hình là mô hình có thể không nhận ra nút bấm.
Astra chọn hướng khác. Với trình duyệt trên máy tính, nó đọc "cây trợ năng" (accessibility tree), vốn là phần mô tả giao diện bằng văn bản mà hệ điều hành cung cấp cho phần mềm đọc màn hình. Mỗi nút và ô nhập liệu đều có tên và thứ bậc riêng. Cách đọc này tiết kiệm token hơn so với xem ảnh chụp màn hình. Ảnh chụp vẫn được dùng cho những thứ chỉ nhìn mới thấy, như nét vẽ trên khung hoặc hình dạng mô hình 3D.
Điểm quan trọng hơn là Astra không hẳn học cách "dùng máy tính", mà học cách viết mã để tự điều khiển máy tính. Nó được cấp một môi trường lập trình liên tục, nơi nó viết một đoạn, chạy, rồi xem kết quả ngay. Sau mỗi bước, hệ thống đọc lại màn hình để kiểm tra hành động vừa rồi có hiệu quả không. Nếu không, nó sửa và thử lại cho đến khi xong. Ngoài ra còn có một lớp an toàn tên Guardian Policy, trong đó một mô hình riêng đánh giá rủi ro của từng hành động. Hành động rủi ro cao sẽ dừng lại chờ con người duyệt.

Con số cũng khớp với cách làm này. Trên OSWorld 2.0, Astra đạt 72,6%, so với 65,7% của thế hệ trước. Thời gian trung bình mỗi tác vụ giảm từ 75 phút xuống 40 phút. Mô hình thông minh hơn thì cần ít bước hơn, nên nhanh hơn và rẻ hơn.
Nhìn rộng ra, nhà báo Tae Kim coi đây là làn sóng tăng trưởng thứ tư trong bốn năm: chatbot, mô hình suy luận, lập trình bằng tác nhân, và giờ là tác nhân vận hành máy tính. Greg Brockman, đồng sáng lập OpenAI, kể rằng từ trước khi thành lập năm 2015, điều đầu tiên họ muốn làm là để mô hình nhìn các điểm ảnh, điều khiển bàn phím và chuột. Khi đó chưa làm được, nên hai năm qua là "kỷ nguyên kết nối", nơi mỗi phần mềm phải có một trình kết nối API riêng. Ông nói GPT-6 cuối cùng đã gần như là một đầu nối đa năng.
Ý tưởng đó còn đi xa hơn màn hình. Ở robot, GPT-6 Astra trực tiếp xuất lệnh định vị cho đầu cánh tay. Trong bài kiểm tra RoboCurve, nó đặt khối vào bát thành công 19 trên 20 lần, trong khi Fable 5.1 của Claude đạt 40%. Đây đều là thao tác đơn lẻ, không chuẩn bị hay tinh chỉnh trước. Chuyên gia Jay Chooi dự đoán mô hình lớn có thể điều khiển cánh tay robot theo thời gian thực sớm nhất là cuối năm nay, muộn nhất là năm 2029.
Trên máy tính, lớp điều khiển là màn hình và chuột, bàn phím. Trên robot, đó là lệnh tư thế cho động cơ. Ở cả hai bên, vòng lặp vẫn là nhận thức, quyết định, hành động, quan sát, rồi làm lại.
Năm 1979, MIT có màn trình diễn nổi tiếng "Put That There": người chỉ vào màn hình, nói "đặt cái đó ở đó", và máy tính làm theo. Bốn mươi bảy năm sau, cỗ máy không chỉ đặt vật lên màn hình mà còn cầm cọ, học đặt từng nét sơn đúng chỗ.
Bức tranh Cầu Cổng Vàng ngày càng rõ nét kia có thể là dấu hiệu cho thấy việc dùng máy tính đang bước vào thế giới vật lý.
Đó là thử nghiệm của các sinh viên Stanford với GPT-6 Astra, mô hình OpenAI vừa phát hành. Họ gắn cho nó một cánh tay robot, một cây cọ và một chiếc camera. Astra nhìn hình ảnh từ camera và tự tìm cách điều khiển cánh tay. Video dài một phút này vượt 2 triệu lượt xem trên X, và Sam Altman cũng trả lời rằng ông muốn có một cái.

Những ngày qua, nhiều người khác cũng thử Astra ở nhiều việc khác nhau. Có người bảo nó dựng mô hình 3D trong Blender. Có người giao cho nó đi tìm kim cương trong Minecraft. Có người cho nó vẽ chân dung. Điểm chung là "computer use", tức khả năng tự vận hành máy tính như một người thật, và đây đang là chủ đề được bàn nhiều nhất.
Một blogger chưa từng dùng Blender đã yêu cầu Astra làm một chiếc tàu con thoi. Khoảng mười phút sau, mô hình hiện ra, xoay và phóng to được. Anh mô tả trải nghiệm này "giống như phép thuật". Nghệ sĩ 3D người Nhật Hirokazu Yokohara thì đưa cho Astra một hình tham khảo, và nó tự mở Blender, làm gần hết công việc. Ông nhận xét mức hoàn thiện chưa hoàn hảo, nhưng đây là lần đầu ông cảm thấy kỷ nguyên đồ họa 3D không còn làm thủ công đã bắt đầu.
Một người dùng giao nhiệm vụ đào kim cương trong Minecraft trước khi đi ngủ. Sáng dậy, anh thấy trong ba lô đã có một viên. Việc này vốn khó, vì phải đi đào, tránh quái vật và tự dựng cả chuỗi công cụ trước.

Vậy vì sao Astra làm được? Kỹ sư Kyle Jeong của Browserbase đã đọc mã nguồn Codex mã nguồn mở của OpenAI để tìm câu trả lời.
Các giải pháp trước đây, từ Computer Use của Anthropic đến Operator của OpenAI, đều theo cách chụp màn hình rồi bấm vào tọa độ pixel. Cách này có điểm yếu: đổi độ phân giải màn hình là mô hình có thể không nhận ra nút bấm.
Astra chọn hướng khác. Với trình duyệt trên máy tính, nó đọc "cây trợ năng" (accessibility tree), vốn là phần mô tả giao diện bằng văn bản mà hệ điều hành cung cấp cho phần mềm đọc màn hình. Mỗi nút và ô nhập liệu đều có tên và thứ bậc riêng. Cách đọc này tiết kiệm token hơn so với xem ảnh chụp màn hình. Ảnh chụp vẫn được dùng cho những thứ chỉ nhìn mới thấy, như nét vẽ trên khung hoặc hình dạng mô hình 3D.
Điểm quan trọng hơn là Astra không hẳn học cách "dùng máy tính", mà học cách viết mã để tự điều khiển máy tính. Nó được cấp một môi trường lập trình liên tục, nơi nó viết một đoạn, chạy, rồi xem kết quả ngay. Sau mỗi bước, hệ thống đọc lại màn hình để kiểm tra hành động vừa rồi có hiệu quả không. Nếu không, nó sửa và thử lại cho đến khi xong. Ngoài ra còn có một lớp an toàn tên Guardian Policy, trong đó một mô hình riêng đánh giá rủi ro của từng hành động. Hành động rủi ro cao sẽ dừng lại chờ con người duyệt.

Con số cũng khớp với cách làm này. Trên OSWorld 2.0, Astra đạt 72,6%, so với 65,7% của thế hệ trước. Thời gian trung bình mỗi tác vụ giảm từ 75 phút xuống 40 phút. Mô hình thông minh hơn thì cần ít bước hơn, nên nhanh hơn và rẻ hơn.
Nhìn rộng ra, nhà báo Tae Kim coi đây là làn sóng tăng trưởng thứ tư trong bốn năm: chatbot, mô hình suy luận, lập trình bằng tác nhân, và giờ là tác nhân vận hành máy tính. Greg Brockman, đồng sáng lập OpenAI, kể rằng từ trước khi thành lập năm 2015, điều đầu tiên họ muốn làm là để mô hình nhìn các điểm ảnh, điều khiển bàn phím và chuột. Khi đó chưa làm được, nên hai năm qua là "kỷ nguyên kết nối", nơi mỗi phần mềm phải có một trình kết nối API riêng. Ông nói GPT-6 cuối cùng đã gần như là một đầu nối đa năng.
Ý tưởng đó còn đi xa hơn màn hình. Ở robot, GPT-6 Astra trực tiếp xuất lệnh định vị cho đầu cánh tay. Trong bài kiểm tra RoboCurve, nó đặt khối vào bát thành công 19 trên 20 lần, trong khi Fable 5.1 của Claude đạt 40%. Đây đều là thao tác đơn lẻ, không chuẩn bị hay tinh chỉnh trước. Chuyên gia Jay Chooi dự đoán mô hình lớn có thể điều khiển cánh tay robot theo thời gian thực sớm nhất là cuối năm nay, muộn nhất là năm 2029.
Trên máy tính, lớp điều khiển là màn hình và chuột, bàn phím. Trên robot, đó là lệnh tư thế cho động cơ. Ở cả hai bên, vòng lặp vẫn là nhận thức, quyết định, hành động, quan sát, rồi làm lại.
Năm 1979, MIT có màn trình diễn nổi tiếng "Put That There": người chỉ vào màn hình, nói "đặt cái đó ở đó", và máy tính làm theo. Bốn mươi bảy năm sau, cỗ máy không chỉ đặt vật lên màn hình mà còn cầm cọ, học đặt từng nét sơn đúng chỗ.
Bức tranh Cầu Cổng Vàng ngày càng rõ nét kia có thể là dấu hiệu cho thấy việc dùng máy tính đang bước vào thế giới vật lý.