07:08 30/07/2026

Ứng dụng AI đưa di sản Hán Nôm bước vào kỷ nguyên số

Ứng dụng trí tuệ nhân tạo (AI) trong xử lý Hán Nôm đang mở ra hướng tiếp cận mới để số hóa, bảo tồn và phát huy giá trị kho tàng di sản văn hóa Việt Nam, đưa những tư liệu quý đến gần hơn với cộng đồng trong kỷ nguyên số.

AI trước "vùng trắng" mang tên Hán Nôm

Hàng trăm năm qua, kho tàng tư liệu Hán Nôm đã lưu giữ nhiều lớp trầm tích về lịch sử, văn hóa, địa lý, văn học, y học cổ truyền và đời sống xã hội của người Việt. Từ những sắc phong, châu bản, gia phả, địa bạ, văn bia đến các thư tịch cổ, hoành phi, câu đối hay những bài thuốc dân gian, mỗi trang tư liệu đều chứa đựng những giá trị mà nhiều thế hệ đã gìn giữ.

Tuy nhiên, phần lớn nguồn di sản này vẫn chưa được khai thác hiệu quả khi số người có khả năng đọc hiểu Hán Nôm ngày càng ít, trong khi nhiều tài liệu chỉ tồn tại dưới dạng ảnh hoặc bản lưu trữ số.

Chú thích ảnh
Chú thích ảnh
PGS.TS Đinh Điền, Giám đốc Trung tâm Ngôn ngữ học Tính toán, Trường Đại học Khoa học Tự nhiên (Đại học Quốc gia TP Hồ Chí Minh), chủ nhiệm đề tài nghiên cứu ứng dụng AI trong xử lý Hán Nôm.

Sự phát triển mạnh mẽ của AI trong những năm gần đây giúp máy tính có thể dịch hàng trăm ngôn ngữ, xử lý văn bản và hỗ trợ nhiều lĩnh vực của đời sống. Thế nhưng, với Hán Nôm - hệ thống văn tự từng được sử dụng suốt nhiều thế kỷ để ghi chép lịch sử, văn hóa và đời sống người Việt - AI vẫn là một "bài toán khó" mà các mô hình phổ biến trên thế giới chưa thể giải quyết trọn vẹn.

Xuất phát từ thực tế đó, nhiều năm qua, PGS.TS Đinh Điền, Giám đốc Trung tâm Ngôn ngữ học Tính toán, Trường Đại học Khoa học Tự nhiên (Đại học Quốc gia TP Hồ Chí Minh), chủ nhiệm đề tài, cùng nhóm cộng sự đã theo đuổi mục tiêu ứng dụng AI để nhận dạng, chuyển tự và dịch tự động Hán Nôm.

Kết quả nghiên cứu được tích hợp trong hệ thống "Kim Hán Nôm", góp phần mở rộng khả năng số hóa, lưu trữ, tra cứu và khai thác nguồn tư liệu quý phục vụ nghiên cứu, giáo dục, bảo tồn và phát huy giá trị di sản văn hóa. Mới đây, nhiệm vụ khoa học và công nghệ "Nghiên cứu xây dựng hệ thống dịch tự động Hán Nôm sang chữ Quốc ngữ giai đoạn 2", do nhóm thực hiện đã được Sở Khoa học và Công nghệ TP Hồ Chí Minh nghiệm thu.

Theo PGS.TS Đinh Điền, nhiều người lầm tưởng các nền tảng AI hiện nay đã có thể dịch Hán Nôm. Thực tế, các mô hình phổ biến chủ yếu được huấn luyện trên dữ liệu chữ Hán hiện đại, trong khi chữ Nôm là hệ thống văn tự đặc thù do người Việt sáng tạo trên cơ sở chữ Hán. Chính khoảng trống về dữ liệu và đặc điểm ngôn ngữ khiến AI chưa thực sự "hiểu" được Hán Nôm như nhiều người vẫn nghĩ.

Chú thích ảnh
Chú thích ảnh
Các tư liệu Hán Nôm như sắc phong, chiếu chỉ, văn bia là nguồn di sản quý giá lưu giữ những thông tin về lịch sử, văn hóa và đời sống xã hội của người Việt qua nhiều thế kỷ.

Ông Điền cho biết, không ít trường hợp người dùng đưa hình ảnh một văn bản Hán Nôm vào các nền tảng AI và nhận được bản dịch khá trôi chảy. Tuy nhiên, kết quả đó không đồng nghĩa AI đã hiểu văn bản. Có những trường hợp, hệ thống tạo ra nội dung hoàn toàn sai nhưng vẫn rất hợp lý về mặt ngôn ngữ, hay còn gọi là hiện tượng "ảo giác".

Với những tác phẩm nổi tiếng như "Truyện Kiều", AI có thể cho kết quả đúng vì nội dung đã xuất hiện nhiều trên Internet. Nhưng với những văn bản ít được số hóa hoặc chưa từng xuất hiện trong dữ liệu huấn luyện, AI dễ đưa ra các bản dịch sai lệch.

"Đó là lý do chúng ta phải có một hệ thống AI chuyên biệt cho Hán Nôm, bởi chữ Nôm là loại chữ đặc thù của cha ông để lại mà hiện nay, các mô hình AI phổ biến vẫn chưa hiểu được", ông Điền chia sẻ.

Chú thích ảnh
Chú thích ảnh
PGS.TS Đinh Điền cùng nhóm nghiên cứu phát triển hệ thống "Kim Hán Nôm", ứng dụng trí tuệ nhân tạo để số hóa, khai thác và phát huy giá trị kho tàng di sản Hán Nôm.

Theo nhóm nghiên cứu, khó khăn lớn nhất trong quá trình xây dựng hệ thống không chỉ nằm ở công nghệ mà còn ở dữ liệu. Muốn AI học được Hán Nôm, trước hết phải có kho dữ liệu đủ lớn và được chuẩn hóa để máy có thể nhận biết từng ký tự, từng câu và mối liên hệ giữa Hán Nôm với chữ Quốc ngữ.

Bạn Nguyễn Đăng Khoa, thành viên nhóm nghiên cứu, hiện là sinh viên năm 3 ngành Công nghệ thông tin hệ Chất lượng cao, Trường Đại học Khoa học Tự nhiên (Đại học Quốc gia TP Hồ Chí Minh), cho biết phần lớn tư liệu Hán Nôm hiện chỉ tồn tại dưới dạng ảnh nên không thể đưa trực tiếp vào mô hình AI để huấn luyện.

"Nhóm phải chủ động đi tìm dữ liệu từ nhiều nguồn khác nhau. Ngoài việc thu thập trên Internet, chúng tôi còn tìm đến các đơn vị lưu giữ tư liệu như các cơ sở Phật giáo, Công giáo để thu thập tài liệu, sau đó trải qua nhiều công đoạn xử lý, trích xuất và gắn nhãn mới có thể xây dựng được bộ dữ liệu phục vụ huấn luyện mô hình", bạn Đăng Khoa cho biết.

Theo Đăng Khoa, điểm khác biệt lớn nhất của Hán Nôm so với nhiều ngôn ngữ hiện đại là hệ thống chữ ghi nghĩa thay vì ghi âm. Mỗi ký tự mang nhiều đặc điểm riêng, số lượng ký tự lớn và cách cấu tạo phức tạp, khiến việc "dạy" AI nhận dạng và xử lý Hán Nôm trở nên khó khăn hơn rất nhiều.

Sau nhiều năm nghiên cứu, nhóm đã xây dựng được kho dữ liệu Hán Nôm quy mô lớn gồm 200.000 ảnh trang văn bản Hán Nôm, 200.000 ảnh đã được gắn nhãn phục vụ huấn luyện mô hình nhận dạng ký tự quang học (OCR), 750.000 cặp câu song ngữ Hán Nôm - Quốc ngữ và hơn 1 triệu câu đơn ngữ Hán Nôm, tương đương khoảng 16 triệu ký tự. Đây là nền tảng quan trọng để phát triển các mô hình AI phục vụ nhận dạng, chuyển tự và dịch tự động Hán Nôm.

Chú thích ảnh
PGS.TS Đinh Điền cùng các thành viên nhóm nghiên cứu miệt mài xây dựng hệ thống AI hỗ trợ nhận dạng, chuyển tự và dịch tự động Hán Nôm.

Đưa di sản đến gần hơn với cộng đồng

Từ nền tảng dữ liệu và các mô hình AI được xây dựng, nhóm nghiên cứu đã phát triển hệ thống "Kim Hán Nôm", hoạt động trên nền tảng website và các thiết bị thông minh chạy hệ điều hành Android, iOS. Hệ thống có khả năng nhận dạng văn bản Hán Nôm từ hình ảnh, chuyển đổi thành văn bản số, dịch sang tiếng Việt và hỗ trợ giải nghĩa, giúp người dùng dễ dàng tiếp cận những nguồn tư liệu mà trước đây chủ yếu chỉ các nhà nghiên cứu Hán Nôm mới có thể đọc hiểu.

Theo PGS.TS Đinh Điền, điểm nổi bật của hệ thống là khả năng xử lý trực tiếp nhiều loại tư liệu như sắc phong, văn bia, hoành phi, câu đối hay các văn bản ngoài thực địa. Chỉ với một chiếc điện thoại thông minh, người dùng có thể chụp ảnh văn bản Hán Nôm, hệ thống sẽ tự động nhận dạng ký tự, chuyển thành văn bản, dịch sang tiếng Việt và hiển thị nội dung ngay trên vị trí của từng dòng chữ, giúp việc tiếp cận di sản trở nên trực quan hơn.

Trước hết, hệ thống mở ra một phương thức tiếp cận trực quan hơn đối với các di sản đang hiện hữu trong đời sống như đình, chùa, miếu, văn bia, hoành phi, câu đối. Khi tham quan đình, chùa, miếu hay các di tích lịch sử, người xem có thể hiểu được nội dung của những câu đối, hoành phi, văn bia vốn trước đây là những dòng chữ khó tiếp cận.

Theo ông Điền, giá trị lớn hơn của AI còn nằm ở việc góp phần phát hiện và khai thác những tư liệu quý đang được lưu giữ trong cộng đồng. Nhiều gia đình hiện vẫn cất giữ sắc phong, gia phả, chiếu chỉ hoặc các văn bản cổ nhưng không biết nội dung và giá trị của chúng.

"Người dân chỉ cần chụp hình một văn bản, hệ thống có thể nhận diện và dịch để họ biết đó là tài liệu gì. Khi hiểu được giá trị của tài liệu, họ sẽ có ý thức hơn trong việc gìn giữ và có thể phối hợp với các cơ quan chuyên môn nếu phát hiện những tư liệu có giá trị đặc biệt", ông Điền cho biết.

Chú thích ảnh
Người dân chỉ cần sử dụng ứng dụng "Kim Hán Nôm" chụp hình văn bản Hán Nôm, hệ thống sẽ nhận dạng ký tự, xử lý và trả kết quả dịch sang tiếng Việt.
Chú thích ảnh
Ngoài ra, người dùng có thể chụp hình các tư liệu, hiện vật có chữ Hán Nôm, hệ thống sẽ tự động nhận dạng, dịch và hiển thị nội dung song song ngay trên hình ảnh gốc.

Dù vậy, theo nhóm nghiên cứu, AI không thay thế vai trò của các chuyên gia Hán Nôm. Những văn bản cổ thường có nhiều dị thể, nhiều cách hiểu và vẫn cần các nhà nghiên cứu kiểm chứng, hiệu đính để bảo đảm độ chính xác. AI trước hết là công cụ giúp rút ngắn thời gian xử lý, từ đó để các chuyên gia tập trung vào công việc phân tích và nghiên cứu chuyên sâu.

Bạn Nguyễn Đăng Khoa cũng nhìn nhận, AI chỉ là "chất xúc tác" thúc đẩy quá trình nghiên cứu nhanh hơn. Thành công của dự án vẫn dựa trên sự kết hợp giữa nền tảng công nghệ và tri thức Hán Nôm. Những người tham gia không chỉ hiểu về công nghệ thông tin mà còn phải học và tiếp cận kiến thức ngôn ngữ học để có thể "dạy" máy hiểu được loại chữ viết đặc biệt này.

Chú thích ảnh
Bạn Nguyễn Đăng Khoa (chính giữa), thành viên nhóm nghiên cứu, cùng các cộng sự xử lý dữ liệu Hán Nôm phục vụ huấn luyện các mô hình trí tuệ nhân tạo.

Đối với PGS.TS Đinh Điền, mục tiêu cuối cùng của dự án không chỉ dừng ở việc xây dựng một phần mềm dịch tự động mà là từng bước chuyển khối lượng lớn tư liệu Hán Nôm đang tồn tại dưới dạng ảnh thành dữ liệu số có thể tìm kiếm, tra cứu và khai thác. Khi đó, các nhà nghiên cứu sẽ không còn phải mất nhiều tháng đọc thủ công từng văn bản mà có thể tìm kiếm thông tin theo từ khóa hoặc câu hỏi trên toàn bộ kho tư liệu đã được số hóa.

Đây cũng là nền tảng để tiếp tục làm sáng tỏ nhiều vấn đề lịch sử, văn hóa còn bỏ ngỏ thông qua việc khai thác hiệu quả nguồn tư liệu Hán Nôm. Nếu trước đây nhiều văn bản cổ chủ yếu nằm yên trong kho lưu trữ hoặc được gìn giữ trong từng gia đình mà ít người có thể đọc hiểu, thì với sự hỗ trợ của AI, kho di sản ấy đang từng bước được số hóa, khai mở và kết nối với cộng đồng.

Chú thích ảnh
Từ các văn bản cổ đến những dòng chữ Hán Nôm trên di tích, công nghệ AI đang góp phần thu hẹp khoảng cách giữa di sản văn hóa và cộng đồng.

Công nghệ không thay thế các chuyên gia Hán Nôm, nhưng đang trở thành công cụ giúp rút ngắn quá trình nghiên cứu, mở rộng khả năng tiếp cận tri thức và tạo thêm cơ hội để những giá trị mà cha ông để lại tiếp tục được gìn giữ, lan tỏa trong đời sống đương đại.

Bài, ảnh và clip: Lưu Niệm/Báo Tin tức và Dân tộc