Trí tuệ nhân tạo tự cải tiến: Mỹ - Trung chạy đua
Mỹ và Trung Quốc đang chạy đua để xây dựng "trí tuệ nhân tạo tự cải tiến" bởi cả hai đều coi đây có thể là yếu tố thay đổi cuộc chơi trong cuộc đua trí tuệ nhân tạo. Nhưng ai sẽ nhanh hơn?
Cuộc chạy đua giành vị thế thống trị về AI giữa Mỹ và Trung Quốc đã bước vào một giai đoạn mới: sử dụng AI để xây dựng những AI tốt hơn.
Các công ty hàng đầu về AI tại hai nước ngày càng tập trung triển khai các mô hình tiên tiến để viết code, thiết kế thí nghiệm và phát triển các kỹ thuật huấn luyện có thể được sử dụng để cải thiện các mô hình mạnh mẽ hơn.
Mục tiêu cuối cùng là đạt được điều mà ngành công nghiệp gọi là tự cải tiến đệ quy (RSI) – tạo ra các hệ thống AI có khả năng tự huấn luyện một cách tự động.
Theo tờ SCMP, RSI có tiềm năng trở thành yếu tố thay đổi cuộc chơi cho ngành công nghiệp AI. Khi các hệ thống AI góp phần xây dựng những thế hệ kế tiếp có năng lực hơn, và những thế hệ này lại càng giỏi hơn trong việc cải thiện thế hệ tiếp theo, quá trình này có thể tạo ra một vòng phản hồi tăng tốc – thúc đẩy sự phát triển của AI lên một quỹ đạo mới.
Trong một bài đăng trên blog tuần trước, OpenAI cho biết họ đặt mục tiêu xây dựng một nhà nghiên cứu AI tự động có khả năng thúc đẩy nghiên cứu học sâu, mặc dù họ vẫn chưa chắc chắn “làm thế nào để đạt được sự đồng bộ và hoàn thiện RSI một cách an toàn”. Công ty mô tả mô hình GPT-6 Astra của mình, được phát hành vào đầu tháng 9, là “mô hình thông minh và đồng bộ nhất thế giới”.
Các nhà phát triển Trung Quốc cũng đang nỗ lực hướng tới RSI. Ngày 31/8, Tang Jie, người sáng lập công ty trí tuệ nhân tạo Z.ai có trụ sở tại Bắc Kinh, cho biết mô hình GLM-6 thế hệ tiếp theo của họ đang hướng tới “sự tự tiến hóa”.
Ai đang dẫn đầu cuộc đua RSI?
Theo các nhà phân tích, Mỹ vẫn dẫn đầu trong việc sử dụng A) để tiến hành nghiên cứu AI một cách độc lập, một tiền đề quan trọng cho sự tự cải tiến liên tục.
Wei Sun, nhà phân tích chính về trí tuệ nhân tạo tại Counterpoint Research, đã chỉ ra nghiên cứu của Anthropic hồi tháng 6 như bằng chứng về lợi thế dẫn đầu sớm của Mỹ. Anthropic cho biết các mô hình Claude đã thiết kế các thí nghiệm, viết mã và phát triển các kỹ thuật sau huấn luyện có thể được chuyển giao cho các mô hình lớn hơn.
Các công ty khác của Mỹ cũng đang đi theo hướng tương tự. Google DeepMind đã phát hành mô hình Gemini 3.8 Flash hôm 2/9 và cho biết phiên bản này được “thiết kế cho kỹ thuật phần mềm dài hạn, các tác nhân tự động và quy trình làm việc phức tạp của doanh nghiệp”. Nhà nghiên cứu Yao Shunyu của Google DeepMind gọi mô hình này là “một bước tiến khổng lồ cho RSI” trong một bài đăng trên X.
OpenAI đã thông báo đạt được mục tiêu phát triển một trợ lý nghiên cứu tự động. Mô hình Astra có thể tự động thực hiện một số thí nghiệm nghiên cứu mà theo một bài đăng trên blog của công ty, “sẽ mất vài ngày để một nhà nghiên cứu lành nghề hoàn thành”. Nhóm Chiến lược Tương lai mới thành lập của công ty cũng đã coi tác động của RSI (Hội chứng căng thẳng lặp đi lặp lại) là một ưu tiên nghiên cứu cốt lõi.
“Các công ty Mỹ dường như vẫn đi trước Trung Quốc vài tháng và có nhiều tài nguyên tính toán hơn để triển khai,” Erich Grunewald, nhà nghiên cứu cấp cao tại Viện Chính sách và Chiến lược Trí tuệ Nhân tạo, cho biết. “Các nhà nghiên cứu Trung Quốc rất giỏi trong việc tối ưu hiệu năng từ phần cứng hạn chế, nhưng những hạn chế về tài nguyên tính toán vẫn gây ra nhiều khó khăn .”
Tuy nhiên, các nhà phân tích nhấn mạnh cả hai quốc gia đều chưa chứng minh được khả năng tự cải tiến hoàn toàn tự chủ, không giới hạn của trí tuệ nhân tạo, điều mà RSI hướng tới.
Kyle Chan, một chuyên gia tại Viện Brookings, cho biết mặc dù trí tuệ nhân tạo có thể tối ưu hóa thiết kế chip hoặc thực thi mã, nhưng những đột phá cơ bản trong kiến trúc mô hình vẫn phụ thuộc vào chuyên môn của con người.

Sự phát triển của AI đã bước vào một giai đoạn mới: sử dụng AI để xây dựng những AI tốt hơn.
Trung Quốc đang theo đuổi “sự tự tiến hóa” như thế nào?
Các phòng thí nghiệm Trung Quốc đang tự xây dựng con đường riêng của mình hướng tới trí tuệ nhân tạo tự cải tiến.
Tại buổi họp báo giữa kỳ của Z.ai vào tháng 8, người sáng lập Tang đã phác thảo “tự huấn luyện hoàn toàn”, lộ trình kỹ thuật cho GLM-6.0, theo đó, công ty đặt mục tiêu AI sẽ tự động quản lý toàn bộ quy trình huấn luyện từ trước khi huấn luyện đến sau khi huấn luyện.
Theo Tang, một thách thức trọng tâm là khả năng đánh giá của mô hình: làm thế nào để hệ thống AI có thể xác định khi nào nên dừng quá trình huấn luyện và tự sửa chữa những sai lầm của mình.
Các phòng thí nghiệm khác của Trung Quốc cũng đã mô tả công trình nghiên cứu của họ theo hướng “tự tiến hóa”. Các nhà nghiên cứu đứng sau MiniMax 2.7 đã nói trong một bài báo có tiêu đề “Những tiếng vọng ban đầu của tự tiến hóa” hồi đầu năm nay rằng mô hình này có thể cập nhật bộ nhớ và xây dựng các kỹ năng phức tạp trong khi thực hiện các thí nghiệm học tăng cường, với kinh nghiệm thu được sẽ được sử dụng ngược lại trong quá trình học tập của nó.
Tháng trước, DeepSeek đã phát triển một “khung” điều khiển giúp các mô hình có quyền tự chủ cao hơn trong việc thực hiện các tác vụ nhiều bước, chạy mã và tương tác với phần mềm bên ngoài.
Tuy nhiên, các chuyên gia cảnh báo những khả năng như vậy không tạo thành một vòng lặp cải tiến đệ quy thực sự.
Trong một bài đăng trên blog vào tháng trước, Philipp Schmid – kỹ sư tại Google DeepMind – lập luận rằng các tác nhân AI có tính tự chủ cao (như của DeepSeek) vẫn phụ thuộc vào con người để xác định xem liệu một thay đổi có thực sự là sự cải tiến hay không.
“Việc tự cải tiến không giới hạn và mang tính đệ quy đòi hỏi nhiều hơn thế. Hệ thống sẽ cải thiện cách thức tìm ra các thay đổi và cách đánh giá những thay đổi đó. Nó sẽ củng cố cơ chế kiểm chứng mà không cho phép thao túng,” Schmid viết. “Bằng chứng công khai cho điều đó vẫn còn hạn chế.”
Hội chứng RSI có gây ra những rủi ro?
Cuộc chạy đua hướng tới RSI đã làm dấy lên những cảnh báo về an toàn trên toàn cầu.
Hôm thứ Ba, cựu nhà nghiên cứu của OpenAI, Jacob Coxon, đã viết trên X rằng ông đã từ chức khỏi Anthropic, cáo buộc cả hai gã khổng lồ AI này đang “chạy đua thẳng đến siêu trí tuệ tự hoàn thiện và đánh cược với mạng sống của chúng ta”.
Nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã cảnh báo việc đẩy nhanh tốc độ gia tăng hội chứng RSI trong thời gian ngắn sắp tới có thể không phải là “hành động tập thể đúng đắn mà cộng đồng nghiên cứu nên thực hiện”.
Tình hình cũng đang trở nên đáng báo động ở Bắc Kinh. Đầu tháng này, ông Wang Lihong, phó giám đốc Cục Điều phối An ninh mạng thuộc Cục Quản lý Không gian mạng Trung Quốc, đã cảnh báo về “những rủi ro cực kỳ khó kiểm soát” sau khi các mô hình tấn công tiên tiến vượt qua các môi trường thử nghiệm (sandbox) để nhắm mục tiêu vào môi trường sản xuất thực tế.
Các nhà phân tích cho rằng việc đào tạo các mô hình dựa trên những tiền lệ có sai sót có nguy cơ làm trầm trọng thêm sự sai lệch.
“Nếu bạn không thể tin tưởng những mô hình AI đó và chúng lại là những mô hình dùng để huấn luyện thế hệ AI tiếp theo, kết quả có thể là sẽ có thêm nhiều mô hình AI sai lệch hơn nữa, gây ra nhiều sự cố bất thường hơn”, Ben Hayum, trợ lý nghiên cứu về chương trình công nghệ và an ninh quốc gia tại Trung tâm An ninh Mỹ mới, cho biết. “Đây là những mối đe dọa an ninh quốc gia đối với Mỹ, Trung Quốc và toàn cầu.”
Nguồn TG&VN: https://baoquocte.vn/tri-tue-nhan-tao-tu-cai-tien-my-trung-chay-dua-443229.html



