08:16 17/08/2026

Trung Quốc tham vọng định hình AI toàn cầu bằng dữ liệu

Trung Quốc đang xuất khẩu không chỉ các mô hình AI. Nước này muốn dữ liệu của mình tác động đến các chatbot trên toàn thế giới.

Chú thích ảnh
Ứng dụng DeepSeek của Trung Quốc trên điện thoại di động. Ảnh: THX/TTXVN

Theo truyền thông Mỹ ngày 16/8, khi ChatGPT vẫn còn là công nghệ mới, các nhà nghiên cứu ở Bắc Kinh đã thử nghiệm khả năng xử lý các câu hỏi bằng tiếng Trung của chatbot này. Phản ứng của họ trước những kết quả thu được rất đáng chú ý.

ChatGPT mô tả cựu ngôi sao bóng rổ Diêu Minh là người phụ nữ Trung Quốc đầu tiên chơi bóng rổ chuyên nghiệp tại Mỹ. ChatGPT cũng nhầm lẫn giữa hai tác phẩm kinh điển của văn học Trung Quốc là “Tây Du Ký” và “Hồng Lâu Mộng”, vốn được viết cách nhau hai thế kỷ.

Trong nghiên cứu công bố năm 2023, các nhà nghiên cứu tại Đại học Công nghệ Bắc Kinh cũng viết rằng ChatGPT tạo ra rất nhiều bình luận thiên lệch về Trung Quốc và không né tránh hoặc từ chối trả lời các câu hỏi chính trị về Trung Quốc.

Kể từ đó, ChatGPT đã được cập nhật nhiều lần và chưa rõ những kết quả trên sẽ khác biệt như thế nào ở thời điểm hiện nay. Tuy nhiên, những ví dụ này cho thấy mối quan ngại cốt lõi trong nỗ lực trở thành cường quốc AI của Trung Quốc: Các hệ thống định hình tương lai đang được đào tạo bằng những bộ dữ liệu chủ yếu bằng tiếng Anh và phản ánh tư duy của phương Tây.

Theo các nhà phân tích, tình trạng mất cân bằng này cũng là điểm dễ bị tổn thương về chiến lược, bởi điều đó đồng nghĩa với việc các quan điểm phương Tây nhiều khả năng sẽ chiếm ưu thế.

Để thu hẹp khoảng cách này và xây dựng các công cụ AI mạnh hơn, Trung Quốc muốn trở thành nhà cung cấp dữ liệu hàng đầu về văn bản, hình ảnh và video được sử dụng để đào tạo các hệ thống AI trên toàn thế giới.

Đầu năm nay, Cục Quản lý Dữ liệu Quốc gia Trung Quốc công bố kế hoạch nhằm biến Trung Quốc thành cường quốc dữ liệu vào cuối năm 2028. Kế hoạch đề xuất xây dựng các bộ dữ liệu chất lượng cao trong hơn 20 lĩnh vực chiến lược, trong đó có nghiên cứu khoa học, sản xuất công nghiệp và phương tiện tự hành.

Kế hoạch trên kêu gọi Trung Quốc chia sẻ các bộ dữ liệu này trên toàn thế giới. Chủ trương này được củng cố vào tháng trước khi Trung Quốc cam kết chia sẻ dữ liệu để hỗ trợ hàng chục nước đang phát triển tham dự Hội nghị Thế giới về Trí tuệ Nhân tạo tại Thượng Hải xây dựng các hệ thống AI riêng. Trung Quốc cũng đã cung cấp miễn phí trên toàn cầu những kho dữ liệu khổng lồ do các phòng thí nghiệm của chính phủ và truyền thông nhà nước tuyển chọn và xây dựng.

Theo các nhà phân tích, mục tiêu có hai mặt: thu hút thêm người dùng vào hệ sinh thái AI của Trung Quốc và thu hẹp khoảng cách với Mỹ trong tiếp cận dữ liệu đào tạo chất lượng cao, yếu tố mà Trung Quốc cho rằng đang giúp Mỹ duy trì vị thế dẫn đầu.

Ông Yu Xiaohui, Chủ tịch Học viện Công nghệ Thông tin và Truyền thông Trung Quốc, nhận định: “Cạnh tranh trong kỷ nguyên AI không chỉ xoay quanh các mô hình và năng lực tính toán, mà còn là cuộc cạnh tranh về nguồn cung dữ liệu chất lượng cao”.

Cuộc đua tìm kiếm dữ liệu đào tạo tốt hơn

Trung Quốc coi AI là công nghệ chiến lược quan trọng nhằm bắt kịp Mỹ và tạo động lực mới cho nền kinh tế. Để thực hiện mục tiêu này, các phòng thí nghiệm Trung Quốc sẽ cần những dữ liệu ngày càng tinh vi hơn.

Trung Quốc có nguồn dữ liệu dồi dào từ hệ thống giám sát quy mô lớn của chính phủ và hàng trăm triệu người sử dụng các nền tảng công nghệ lớn nhất nước. Tuy nhiên, dữ liệu bị phân mảnh, nằm rải rác trong các hệ thống riêng biệt của các cơ quan và doanh nghiệp khác nhau.

Do đó, các phòng thí nghiệm Trung Quốc gặp khó khăn khi muốn tìm đủ dữ liệu hữu ích cho các mô hình của mình. Đây là một trong những lý do các phòng thí nghiệm Trung Quốc phụ thuộc nhiều vào quy trình “chưng cất”, trong đó các nhà nghiên cứu thu thập dữ liệu từ những hệ thống mạnh và sử dụng dữ liệu đó để xây dựng các mô hình riêng.

Theo các chuyên gia, giải quyết những trở ngại trong nước đối với dòng dữ liệu là ưu tiên hàng đầu của Trung Quốc. Cục Quản lý Dữ liệu Quốc gia Trung Quốc cho biết trong kế hoạch rằng họ muốn phá bỏ những hệ thống dữ liệu biệt lập này để chính phủ, doanh nghiệp và giới học thuật có thể chia sẻ dữ liệu.

Trong khi đó, Mỹ không gặp tình trạng thiếu dữ liệu cấp bách tương tự. Các nhà cung cấp dữ liệu như Mercor và Scale AI không chỉ tuyển người gắn nhãn hình ảnh ô tô hoặc các vật thể khác để phần mềm AI có thể nhận diện chúng. Các công ty này còn tuyển các nhà toán học để chú thích các chứng minh toán học và luật sư để đánh dấu các bản tóm tắt pháp lý, qua đó giúp các mô hình AI trở nên tinh vi hơn.

Để bắt kịp, kế hoạch của Cục Quản lý Dữ liệu Quốc gia Trung Quốc yêu cầu nước này chuyển sang loại dữ liệu có giá trị cao tương tự, thay thế việc gắn nhãn thủ công giá rẻ bằng gắn nhãn dữ liệu do chuyên gia thực hiện. Kế hoạch thậm chí kêu gọi các trường đại học xây dựng các khóa học về gắn nhãn dữ liệu và khuyến khích sinh viên mới tốt nghiệp tìm kiếm việc làm trong lĩnh vực này.

Dữ liệu AI mang đặc trưng Trung Quốc

Trung Quốc cũng muốn dữ liệu của mình trở thành một phần nguyên liệu đầu vào được sử dụng để xây dựng các mô hình. Nước này đã cho phép các nhà phát triển tiếp cận miễn phí một số bộ dữ liệu lớn trên các kho lưu trữ toàn cầu như GitHub và Hugging Face.

Bộ dữ liệu lớn nhất trong số này có tên WanJuan (Vạn quyển), có thể được các nhà phát triển sử dụng làm nền tảng để xây dựng hoặc tinh chỉnh các hệ thống AI.

Bộ dữ liệu do Phòng thí nghiệm AI Thượng Hải xây dựng, bao gồm các lĩnh vực lịch sử, thể thao, luật pháp, các sự kiện thời sự, y học và văn học và được thiết kế phù hợp với các giá trị chủ đạo của Trung Quốc. Ngoài tiếng Trung, Vạn quyển còn có các phiên bản bằng tiếng Arab, tiếng Hàn, tiếng Nga, tiếng Thái và tiếng Việt.

Nỗ lực của Trung Quốc cũng dựa trên việc các mô hình AI giá rẻ của nước này ngày càng được đón nhận, trong đó có những mô hình có khả năng hoạt động gần tương đương các mô hình đắt tiền hơn của Mỹ.

Theo các chuyên gia, những bộ dữ liệu này có thể hấp dẫn người dùng tại các nước đang phát triển, nơi các mô hình AI của Trung Quốc đã đạt được những bước tiến đáng kể.

Thùy Dương/Báo Tin tức và Dân tộc