Chile launches the first open source AI model designed for Latin American cultures
by Sofia Linna, Published on: 01/10/2026
Bài được đưa lên Internet ngày: 01/10/2026
Các mô hình AI đang thay đổi cách chúng ta sáng tạo, chia sẻ và gìn giữ văn hóa. Đồng thời, vấn đề thiếu sự đa dạng (hay tính đồng nhất) nảy sinh khi các mô hình chủ yếu được huấn luyện bằng dữ liệu tiếng Anh và đưa ra thông tin sai lệch về thực tế tại các khu vực khác nhau. Nếu được phát triển với tinh thần bao trùm và đa dạng, các mô hình ngôn ngữ lớn (LLM) có tiềm năng thực sự trong việc mở rộng khả năng tiếp cận, bảo tồn di sản, tăng cường sự hiện diện của các nền văn hóa đa dạng và khơi nguồn cho những hình thức sáng tạo mới. Đây chính là ý tưởng cốt lõi đằng sau Latam-GPT.
Latam-GPT là mô hình ngôn ngữ lớn (LLM) nguồn mở đầu tiên của Chile được huấn luyện dựa trên các nền văn hóa Mỹ Latinh. Mô hình AI này lần đầu tiên được công bố vào tháng 2 năm 2026 tại Hội nghị Thượng đỉnh Hành động về Trí tuệ Nhân tạo ở Paris, nhưng quá trình phát triển đã bắt đầu từ khoảng năm 2023, khi một nhóm nghiên cứu tại Trung tâm Quốc gia về Trí tuệ Nhân tạo (CENIA) của Chile bắt đầu tìm cách xây dựng một LLM dành riêng cho khu vực dựa trên các mô hình AI nguồn mở hiện có sẵn.
Ngay từ đầu, nhóm nghiên cứu tại CENIA đã mong muốn "học hỏi và xây dựng một nền tảng nguồn mở, chú trọng đặc biệt đến những khác biệt về ngôn ngữ văn hóa, cũng như lịch sử văn hóa và các quan điểm đa dạng trong khu vực Mỹ Latinh", bà Gabriela Arriagada Bruneau – nhà nghiên cứu liên kết tại CENIA kiêm phó giáo sư về AI và đạo đức dữ liệu tại Đại học Công giáo Giáo hoàng Chile – giải thích.
Khắc phục khoảng cách về sự hiện diện văn hóa
Latam-GPT không có ý định cạnh tranh với ChatGPT, Google Gemini hay các công cụ phổ thông tương tự. Thay vào đó, mô hình này hướng tới việc cung cấp một cơ sở hạ tầng nền tảng chính xác và hiệu quả hơn để phát triển thêm các ứng dụng AI dành riêng cho khu vực. Tầm nhìn đằng sau mô hình này trở nên rõ ràng khi nhóm nghiên cứu tại CENIA xem xét dữ liệu của các LLM phổ biến hiện nay.
"Chúng tôi muốn đánh giá mức độ hiện diện của các nền văn hóa, và kết quả cho thấy chưa đến 2% tổng số dữ liệu huấn luyện mà chúng tôi khảo sát có chứa dữ liệu thực tế bằng tiếng Tây Ban Nha hoặc tiếng Bồ Đào Nha", bà Arriagada Bruneau giải thích.
Nhóm nghiên cứu cũng nhận thấy những vấn đề vượt xa phạm vi chỉ đơn thuần là gia tăng nội dung tiếng Tây Ban Nha và tiếng Bồ Đào Nha. Một vấn đề quan trọng khác liên quan đến cách các mô hình AI thể hiện những khác biệt về lịch sử và văn hóa trong khu vực Mỹ Latinh.
Cô nói: “Vấn đề không chỉ là xử lý ngôn ngữ mà còn là những câu hỏi sâu sắc hơn. "Một mô hình nên đề cập đến những khác biệt trong lịch sử như thế nào? Chúng tôi biết rằng cách bạn đào tạo mô hình và cách thức bạn đặt bất kỳ loại bộ lọc hoặc điểm chuẩn nào sẽ có tác động đến cách đầu ra sẽ thể hiện những điều đó."
Để giải quyết hiệu quả những vấn đề này, dự án chủ yếu dựa vào sự hợp tác. CENIA làm việc với các đối tác từ hơn 20 quốc gia Mỹ Latinh, bao gồm các đơn vị học thuật và chính phủ, các tổ chức phi lợi nhuận và cộng đồng địa phương.
Kiểm tra kiến thức thông qua sự tham gia của cộng đồng vào các điểm chuẩn
Cách tiếp cận hợp tác của Latam-GPT cũng đang định hình cách đánh giá mô hình. Bằng cách phát triển các tiêu chuẩn riêng của mình, nhóm có thể kiểm tra mức độ mà các mô hình ngôn ngữ hiểu chính xác kiến thức của khu vực.
Arriagada Bruneau nói: “Chúng tôi đã xây dựng các tiêu chuẩn và tôi nghĩ đây là một cách học tập rất hay”. “Nó đã trở thành một sự đón nhận rất tốt đẹp của cộng đồng về cách chúng tôi nghĩ về các mô hình ngôn ngữ.”
Một trong số đó là Choclo, một chuẩn mực nguồn mở tập trung vào kiến thức văn hóa Mỹ Latinh. Choclo có ý định nắm bắt sự phong phú, đa dạng và đặc trưng của kiến thức văn hóa Mỹ Latinh. Nó chứa hơn 100.000 hàng câu hỏi bao gồm các chủ đề như địa lý, động vật, thực vật, truyền thống, ẩm thực và nhân vật công chúng. Cách tiếp cận này không chỉ là về kiến thức chung mà LLM thường thu được từ Internet mà còn về việc thu hút mọi người cung cấp kiến thức này.
Ngoài Choclo, nhóm còn phát triển tiêu chuẩn nguồn mở Trueque, bao gồm 500 câu hỏi được tuyển chọn để kiểm tra kiến thức thực tế và sự phù hợp về văn hóa. Để đào tạo thêm Latam-GPT, nền tảng trò chuyện tương tác thử nghiệm Copuchat đã được tạo ra để đào tạo mô hình.
Tính mở, quản trị dữ liệu và đạo đức AI
Như Arriagada Bruneau giải thích, tính mở là trọng tâm của dự án, bao gồm cả nguồn mở và trọng số mở (Open Source and Open Weights). Nhóm cũng đang tập trung vào các câu hỏi xung quanh quản trị dữ liệu và đạo đức AI, bao gồm tính minh bạch, quyền riêng tư, thành kiến và đa dạng ngôn ngữ.
“Chúng tôi áp dụng những gì có thể gọi là ‘các nguyên tắc đạo đức truyền thống’ – bao gồm tính minh bạch, trách nhiệm, sự công bằng và việc tính đến các yếu tố thiên kiến,” bà chia sẻ. “Tuy nhiên, chúng tôi cũng cân nhắc, chẳng hạn như các tiêu chí về sự đa dạng ngôn ngữ.”
Phối hợp cùng nhóm GobLab UAI, đội ngũ tại CENIA đã xây dựng một bản công bố thông tin minh bạch, trong đó trình bày chi tiết cơ sở lý giải cho các biện pháp can thiệp dữ liệu của dự án cũng như các tiêu chuẩn về quyền riêng tư được tuân thủ. Do quy định về AI tại Chile còn hạn chế, phần lớn khuôn khổ về AI có trách nhiệm của dự án đều dựa trên cam kết của chính nhóm thực hiện đối với tính mở và đạo đức trong lĩnh vực AI.
Giai đoạn hai: tăng cường năng lực cho Latam-GPT và đẩy mạnh hợp tác khu vực
Khi dự án bước sang giai đoạn hai, trọng tâm được đặt vào việc củng cố khả năng suy luận và giải quyết vấn đề của Latam-GPT, cũng như mở rộng quá trình huấn luyện dựa trên các yếu tố ngữ cảnh. CENIA cũng đang hợp tác với các nhà nhân học, xã hội học và đại diện tư vấn từ nhiều cộng đồng bản địa để tìm kiếm khả năng tích hợp ngôn ngữ và tri thức bản địa vào hệ thống.
Nhằm tăng cường hơn nữa sự hợp tác trong khu vực, nhóm đang xây dựng một liên minh chiến lược với Brazil. Những mối quan hệ hợp tác này không chỉ giúp dự án mở rộng năng lực kỹ thuật mà còn góp phần thách thức quan niệm cho rằng việc phát triển AI bắt buộc phải tuân theo một lộ trình định sẵn.
Đây có thể chính là một trong những đóng góp quan trọng nhất của Latam-GPT. Dự án không chỉ đơn thuần bổ sung dữ liệu từ Mỹ Latinh vào các mô hình AI mà còn tập trung khám phá ý nghĩa thực sự của việc phát triển một mô hình ngay tại khu vực này: “có nhiều cách khác nhau để chúng ta làm chủ công nghệ, biến nó thành công cụ phục vụ nhu cầu và bối cảnh thực tế của các nhóm cộng đồng khác nhau”.
Tác giả: admin
Ý kiến bạn đọc
Những tin cũ hơn
Trang Web này được thành lập theo Quyết định số 142/QĐ-HH do Chủ tịch Hiệp hội các trường đại học, cao đẳng Việt Nam – AVU&C (Association of Vietnam Universities and Colleges), GS.TS. Trần Hồng Quân ký ngày 16/09/2019, ngay trước thềm của Hội thảo ‘Xây dựng và khai thác tài nguyên giáo dục mở’ do 5...
Chile ra mắt mô hình AI nguồn mở đầu tiên được thiết kế cho các nền văn hóa Mỹ Latinh
Di sản Mở trong Kỷ nguyên trí tuệ nhân tạo
‘Khung Giáo dục Văn hóa và Nghệ thuật của UNESCO’ - bản dịch sang tiếng Việt
‘Lập luận về AI Công: Hiện thực hóa thông qua di sản văn hóa’ - bản dịch sang tiếng Việt
‘Tổng quan về không gian chung dữ liệu sách châu Âu’ - bản dịch sang tiếng Việt
‘Báo cáo của Nhóm chuyên gia độc lập về Trí tuệ nhân tạo và Văn hóa’ - bản dịch sang tiếng Việt
‘Liệu các bot AI có đang đẩy di sản văn hóa vào môi trường phi trực tuyến?’ - bản dịch sang tiếng Việt
Độc giả của Giáo dục Mở
Sổ tay Nghiên cứu Mở của Mạng lưới Cao học Toàn cầu Tài nguyên Giáo dục Mở - GO-GN (Global OER - Graduate Network)
Các bài toàn văn trong năm 2025
Các bài trình chiếu trong năm 2025
Các lớp tập huấn thực hành ‘Khai thác tài nguyên giáo dục mở’ tới hết năm 2025
Tập huấn thực hành ‘Khai thác tài nguyên giáo dục mở’ cho giáo viên phổ thông, bao gồm cả giáo viên tiểu học và mầm non tới hết năm 2025
Các tài liệu dịch sang tiếng Việt tới hết năm 2025
DigComp 3.0: Khung năng lực số châu Âu
Loạt bài về AI và AI Nguồn Mở: Công cụ AI; Dự án AI Nguồn Mở; LLM Nguồn Mở; Kỹ thuật lời nhắc; Tín hiệu CC
Bộ các tài liệu hướng dẫn của UNESCO cho các chính phủ và cơ sở để triển khai Khuyến nghị Tài nguyên Giáo dục Mở
Hướng dẫn thực hành về Giáo dục Mở cho các học giả: Hiện đại hóa giáo dục đại học thông qua các thực hành Giáo dục Mở (dựa trên Khung OpenEdu)
Chứng chỉ Creative Commons cho các nhà giáo dục, thủ thư hàn lâm, và văn hóa mở
Các mô hình bền vững Tài nguyên Giáo dục Mở (TNGDM) - Tổng hợp
ORCID - Quy trình làm việc
Tổng hợp các bài của Nhóm các Nhà cấp vốn Nghiên cứu Mở (ORFG) đã được dịch sang tiếng Việt
Tổng hợp các bài của Liên minh S (cOAlition S) đã được dịch sang tiếng Việt
Europeana - mô hình mẫu về hệ thống liên thông, Dữ liệu Mở (Liên kết) và dữ liệu FAIR của OpenGLAM/Văn hóa Mở
Loạt bài về Khoa học Mở (KHM): Định nghĩa các khái niệm của KHM; Bộ công cụ KHM của UNESCO bản tiếng Việt; Năm KHM và chuyển đổi sang KHM;
‘ĐÁNH DẤU KHÓA HỌC MỞ VÀ KHAM ĐƯỢC: CÁC THỰC HÀNH TỐT NHẤT VÀ CÁC TRƯỜNG HỢP ĐIỂN HÌNH’ - VÀI THÔNG TIN HỮU ÍCH
Khóa học cơ bản về Dữ liệu Mở trong chương trình học tập điện tử trên Cổng Dữ liệu châu Âu