Ghi nhận nguồn gốc trong Kỷ nguyên AI

Thứ hai - 10/08/2026 18:50
Image by Diego Delso is licensed under CC BY-SA 4.0 via Wikimedia Commons.
Image by Diego Delso is licensed under CC BY-SA 4.0 via Wikimedia Commons.

Attribution in the Age of AI

Posted 24 July 2026 by Jack Hardinges, Irina Bejan

Theo: https://creativecommons.org/2026/07/24/attribution-in-the-age-of-ai/

Bài được đưa lên Internet ngày: 24/07/2026

Ghi nhận nguồn gốc là cơ chế cho phép một mẩu kiến ​​thức hoặc tác phẩm sáng tạo được kết nối với những người đã tạo ra nó. Khi các hệ thống AI tạo ra đầu ra mà không có nguồn gốc, kết nối đó bị phá vỡ, khiến việc tin tưởng thông tin, xác minh tính chính xác hoặc ghi nhận công lao trở nên khó khăn hơn. Vào tháng 3, chúng tôi đã phát hành "Ghi nhận nguồn gốc và đầu ra của AI" (bản dịch sang tiếng Việt), một bản tóm tắt vấn đề xem xét lý do tại sao việc ghi nhận nguồn gốc trong các hệ thống AI thường khó thực hiện chính xác. Các tác giả Jack Hardinges (Creative Commons) và Irina Bejan (OpenMined) đã đi sâu hơn vào câu hỏi này, và lập luận rằng những khoảng trống trong việc ghi nhận nguồn gốc không phải là tác dụng phụ không thể tránh khỏi của cách thức AI hoạt động. CC cho rằng đây là một bước quan trọng tiếp theo trong cuộc thảo luận này.

Giới thiệu

Việc ghi nhận nguồn gốc luôn là nền tảng của việc làm việc với sự sáng tạo và kiến ​​thức của người khác.

Như Creative Commons nhắc nhở chúng ta, (bản dịch sang tiếng Việt) việc thực hành ghi nhận nguồn gốc phục vụ nhiều chức năng quan trọng, từ việc cung cấp bằng chứng có thể kiểm chứng cho một tuyên bố, đến việc thể hiện sự tôn trọng đối với công việc của người khác, và tạo ra các con đường cho lưu lượng truy cập và giá trị tài chính được lưu chuyển.

Mặc dù tầm quan trọng của việc ghi nhận nguồn gốc, nhiều hệ thống AI hiện nay lại không thừa nhận các nguồn kiến ​​thức và sự sáng tạo đã tạo nên chúng.

Một nghiên cứu gần đây do Dự án Tiết lộ AI (AI Disclosures Project) dẫn dắt cho thấy hơn 30% phản hồi của các Mô hình ngôn ngữ lớn (LLM) hỗ trợ tìm kiếm hàng đầu không cung cấp bất kỳ sự ghi nhận nào. Ngay cả khi việc ghi nhận nguồn gốc được cung cấp, nó vẫn có thể bị hạn chế theo những cách thức ẩn khuất đối với người dùng và những thách thức kỹ thuật sâu sắc vẫn tồn tại trong việc kết nối kết quả đầu ra từ AI với các nguồn mà chúng được tạo ra.

Mặc dù vậy, chúng tôi tin rằng có nhiều lý do chính đáng để lạc quan rằng hệ thống AI có thể ghi nhận nguồn gốc mà chúng sử dụng. Không hoàn hảo và không phải luôn luôn, nhưng đủ và ngày càng cải thiện, đến mức chúng ta nên bác bỏ lập luận rằng việc thiếu ghi nhận nguồn gốc là một tác dụng phụ không thể tránh khỏi trong cách hoạt động của công nghệ. Tài sản chung không nhất thiết phải trở thành “chất nền ẩn”.

Lưu ý về thuật ngữ

Trong bài đăng này, chúng tôi hiểu ghi nhận nguồn gốc là thực hành kết nối một chế tác (artifact) với các nguồn dữ liệu được sử dụng để tạo ra nó. Điều này là cố ý rộng rãi. Như chúng tôi giải thích, hệ thống AI có thể thực hành các hình thức ghi nhận khác nhau đối với việc ghi nhận nguồn gốc cho các mục đích khác nhau và hữu ích. Chúng tôi không coi việc ghi nhận nguồn gốc là một yêu cầu hoặc điều kiện pháp lý cụ thể. Chúng tôi cũng sử dụng “hệ thống AI” một cách rộng rãi, vì hầu hết những gì chúng tôi thảo luận đều áp dụng cho nhiều mô hình và công nghệ xung quanh (mặc dù một số phương pháp chủ yếu áp dụng cho các hệ thống tạo đầu ra văn bản).

Lý do để lạc quan

1. Hệ thống AI đã phát triển theo những cách hỗ trợ việc ghi nhận nguồn gốc.

Làn sóng đầu tiên của các công cụ dựa trên LLM về cơ bản là các giao diện người dùng thực hiện lệnh gọi đến một mô hình tĩnh, được đào tạo trước (hoặc “trình bao bọc ChatGPT mỏng” - thin ChatGPT wrappers). Đầu ra từ những công cụ này là một chức năng của bất kỳ thứ gì mà mô hình đã được thể hiện trong quá trình đào tạo mà không có quyền truy cập trực tiếp vào các nguồn.

Điều này đã thay đổi nhanh chóng. Giờ đây, các kiến ​​trúc như tạo sinh tăng cường truy xuất - RAG (Retrieval Augmented Generation) cho phép các hệ thống AI thu thập dữ liệu mới (ví dụ như các trang web hoặc tệp của người dùng) để tạo ra kết quả đầu ra.

Việc thực hành truy xuất này giúp các hệ thống AI dễ dàng hơn trong việc ghi nhận nguồn gốc. Khi các hệ thống tạo ra đầu ra dựa trên nội dung được truy xuất, chúng có thể được huấn luyện và hướng dẫn để gắn các tuyên bố ở đầu ra với các nguồn cụ thể nơi các tuyên bố đó có thể được chứng thực. Điều này cung cấp một hình thức ghi nhận công lao và cho phép người dùng theo dõi đến các trang web hoặc truy tìm lại các tệp của riêng họ.

Ví dụ, Claude có thể cung cấp chú thích cuối trang với các liên kết có thể nhấp vào đến các nguồn. Để làm điều này, nó chia các tài liệu nguồn mà nó truy xuất thành các “khối” (chunks), mỗi khối có một ID duy nhất. Theo cài đặt mặc định, nó sẽ—ít nhất là một cách có chọn lọc—trích dẫn ID của các khối hỗ trợ các tuyên bố được đưa ra ở đầu ra và hiển thị chúng dưới dạng các liên kết có thể nhấp vào ở chú thích cuối trang. Tính năng Trích dẫn của Claude có thể được sử dụng để thực hiện việc này thường xuyên và nhất quán hơn, đồng thời cho phép đầu ra trỏ đến các đoạn văn chính xác từ các tệp của người dùng. Nó hoạt động bằng cách trích xuất các khối nguồn, chẳng hạn như các trích dẫn, và chèn chúng, nguyên văn, vào kết quả đầu ra.

Còn có các phương pháp tiếp cận khác. Pleias phát triển các mô hình AI nguồn mở nhỏ gọn sử dụng dữ liệu được cấp phép mở và thuộc phạm vi công cộng. Các mô hình Pleias-RAG được thiết kế để tạo ra đầu ra chỉ từ các nguồn được truy xuất. Thay vì chia nhỏ và chèn, mô hình tạo ra cả đầu ra và bản thân trích dẫn hỗ trợ trong một lần xử lý duy nhất. Cách tiếp cận này linh hoạt hơn, vì trích dẫn không bị ràng buộc bởi các khối được xác định trước, mà điều đó có nghĩa là hệ thống không thể đảm bảo hoàn toàn rằng các trích dẫn của nó hoàn toàn khớp với nguồn. Đối với người dùng, kết quả trông tương tự: một đầu ra có các tuyên bố được truy vết đến các nguồn, với các đoạn trích dẫn và các liên kết có thể nhấp (nếu ứng dụng được xây dựng trên mô hình nguồn mở lựa chọn thiết kế này).

Vẫn còn chỗ để cải thiện ở đây. Hầu hết các hệ thống AI không ghi nhận nguồn gốc được truy xuất một cách có hệ thống như các mô hình Pleias-RAG. Ngay cả khi các hệ thống làm như vậy, nó thường không đạt đến định dạng Tiêu đề Tác giả Nguồn Giấy phép - TASL (Title Author Source License) đầy đủ mà CC khuyến nghị. Và các khung như Kiểm soát Dựa trên Ghi nguồn (Attribution-Based Control) của OpenMined chứng minh cách các hệ thống có thể thực hiện một hình thức truy xuất phi tập trung hơn, bảo vệ quyền riêng tư, trong đó dữ liệu được truy vấn tại nơi nó tồn tại thay vì được sao chép từ hệ thống của người dùng hoặc từ web vào một chỉ mục tập trung.

Nhìn chung, các kiến ​​trúc truy xuất đã cho phép thực hành ghi nhận nguồn gốc, thể hiện sự cải tiến mạnh mẽ so với các hộp đen được LLM hỗ trợ đầu tiên mà chúng ta từng tiếp xúc. Những phát triển này đã khiến các nhà nghiên cứu từ Dự án Công bố Thông tin AI và các cộng sự của họ kết luận rằng “khoảng trống trong việc ghi nhận nguồn gốc là do các lựa chọn thiết kế, chứ không chỉ đơn thuần là những hạn chế kỹ thuật. Các hệ thống hoạt động tốt nhất cho thấy rằng việc ghi nhận nguồn gốc minh bạch và toàn diện là khả thi về mặt kỹ thuật hiện nay”.

2. Ghi nhận nguồn gốc dữ liệu là một lĩnh vực nghiên cứu tích cực.

Các cách tiếp cận ghi nhận nguồn gốc được mô tả ở trên có thể cung cấp bằng chứng xác nhận, nhưng chúng không thực sự chứng minh rằng một nguồn được liệt kê đã gây ra kết quả đầu ra. Chúng thường chỉ liệt kê một nguồn duy nhất và chỉ đề cập đến các nguồn mà hệ thống đã truy cập trong quá trình suy luận.

Sử dụng các phương pháp này, một hệ thống có thể dựa vào nhiều nguồn để tạo ra kết quả đầu ra, xuyên suốt quá trình huấn luyện và suy luận, nhưng chỉ liệt kê một nguồn duy nhất làm bằng chứng xác nhận.

Nghiên cứu đang được tiến hành để giải quyết câu hỏi khó hơn: “Với tất cả những gì hệ thống đã sử dụng, nguồn nào đã định hình kết quả đầu ra này, sao cho việc loại bỏ chúng sẽ làm thay đổi kết quả?”

Một số phương pháp cố gắng trả lời câu hỏi này bằng cách đọc trạng thái nội bộ của mô hình để ước tính đầu vào nào quan trọng đối với đầu ra. Trọng số chú ý hoạt động bằng cách theo dõi sự tập trung của mô hình trên các tài liệu nguồn được truy xuất khi nó tạo ra đầu ra. Tỷ lệ chú ý dành cho một nguồn nhất định đôi khi được sử dụng làm thước đo cho mức độ quan trọng của nó. Các phương pháp dựa trên gradient thì đo lường độ nhạy, tìm cách tính toán xem câu trả lời sẽ thay đổi bao nhiêu nếu mỗi đầu vào được thay đổi một chút, với giả định rằng các đầu vào mà đầu ra nhạy cảm nhất là những đầu vào đã định hình nó.

Một nhóm phương pháp khác tuân theo logic “loại bỏ một nguồn” để cố gắng xác định xem kết quả đầu ra sẽ thay đổi như thế nào nếu một trong những nguồn tài liệu của nó bị loại bỏ.

Để làm điều này một cách hoàn hảo, cần phải chạy lại quá trình suy luận với các nguồn khác nhau bị giữ lại mỗi lần. Điều này nhanh chóng trở nên tốn kém về mặt tính toán, vì việc ghi nhận nguồn gốc ở cấp độ từng đoạn văn riêng lẻ có thể đồng nghĩa với hàng trăm lần chạy lại cho mỗi kết quả đầu ra. Hầu hết các nghiên cứu đều cố gắng xấp xỉ hiệu ứng này bằng cách sử dụng các phương pháp khác nhau để giảm chi phí tạo ra kết quả phản thực. AttriBoT tính xấp xỉ sự thay đổi trong phản hồi của hệ thống khi các đoạn cụ thể của nguồn được truy xuất bị loại bỏ bằng cách kiểm tra các khối nội dung nguồn lớn trước khi “phóng to” vào các đoạn nhỏ hơn. ContextCite xem xét các tập con ngẫu nhiên của các nguồn để dự đoán câu trả lời sẽ thay đổi như thế nào khi các nguồn được bật và tắt. OpenMined đang thử nghiệm với các giá trị Shapley, hoạt động bằng cách tính trung bình đóng góp biên của mỗi nguồn trên nhiều tổ hợp khác nhau của các nguồn.

Logic phản thực tế y hệt này cũng có thể được áp dụng cho dữ liệu huấn luyện thay vì các nguồn dữ liệu được truy xuất.

Các hàm ảnh hưởng ước tính, mà không cần huấn luyện lại, mức độ nhạy cảm của đầu ra mô hình đối với từng nguồn huấn luyện và do đó, việc loại bỏ một nguồn sẽ làm thay đổi kết quả như thế nào. Việc này liên quan đến việc đảo ngược một ma trận ghi lại cách mọi tham số trong mô hình tương tác với mọi tham số khác. Kích thước của ma trận này bằng bình phương số lượng tham số của toàn bộ mô hình. Đối với các mô hình hiện nay, thường vượt quá 3 nghìn tỷ tham số, con số này quá lớn để lưu trữ, chứ chưa nói đến việc tính toán. Do đó, hầu hết các tiến bộ trong việc ghi nhận nguồn gốc dữ liệu huấn luyện đều liên quan đến việc đưa ra các ước tính về việc thiếu điểm dữ liệu huấn luyện nào sẽ làm thay đổi đầu ra của mô hình nhiều nhất. Các nhà nghiên cứu tại Anthropic đã thử nghiệm một kỹ thuật gọi là EK-FAC để tính xấp xỉ ma trận khổng lồ đó bằng một ma trận thay thế có cấu trúc đơn giản hơn. Phương pháp lặp Arnoldi chỉ giữ lại các hướng chủ đạo của ma trận. Những phương pháp khác giảm chi phí theo những cách khác nhau. TracIn bỏ qua ma trận và thay vào đó quan sát các tham số mô hình tại các thời điểm khác nhau trong quá trình huấn luyện để đánh giá cách một đầu vào cụ thể định hình đầu ra, còn TRAK coi mô hình đã được huấn luyện như thể đó là một mô hình tuyến tính đơn giản, điều này làm cho việc tính toán cùng một ước tính trở nên rẻ hơn nhiều.

Các nhà nghiên cứu đã phát hiện ra rằng các ước tính về đóng góp của dữ liệu huấn luyện có thể khá chính xác đối với các mô hình nhỏ, đơn giản, nhưng nhanh chóng trở nên không đáng tin cậy khi mô hình phát triển, và các phương pháp khác nhau có thể không đồng ý về tác động của một nguồn cụ thể. Ngoài ra, mặc dù chúng có thể - có lẽ - chỉ ra các ví dụ huấn luyện riêng lẻ định hình đầu ra nhiều nhất, nhưng những ví dụ đó khó có thông tin về tác giả hoặc nguồn gốc của chúng. Việc xác định một nguồn huấn luyện có ảnh hưởng không giống như việc có thể ghi nguồn đúng cho nó.

Mặc dù không hoàn hảo, các phương pháp được mô tả ở đây là sản phẩm của một lĩnh vực nghiên cứu đang phát triển dành riêng cho việc ghi nguồn cho dữ liệu, và có lý do để kỳ vọng một số phương pháp sẽ được đưa vào các hệ thống AI chính thống. Nhìn rộng hơn nữa, hầu hết các hệ thống chúng ta có ngày nay không được xây dựng để bảo tồn thông tin về các nguồn mà chúng sử dụng, đặc biệt là trong quá trình huấn luyện. Chúng tôi hy vọng rằng sẽ có nhiều lựa chọn thiết kế chú trọng đến nguồn gốc hơn ngay từ đầu (chẳng hạn như dữ liệu huấn luyện được chọn lọc và có thể nhận dạng liên tục hơn), thay vì việc ghi nhận nguồn gốc phải được thêm vào các hệ thống mà không lường trước được tầm quan trọng của nó.

3. Áp lực pháp lý đối với các nhà phát triển AI trong việc tiết lộ nguồn đang gia tăng.

Nếu không có sự can thiệp, các nhà phát triển AI đã tiết lộ rất ít về nội dung mà mô hình của họ được huấn luyện hoặc có quyền truy cập. Nhiều người dường như coi việc tiết lộ dữ liệu huấn luyện, đặc biệt là, như một gánh nặng không cần thiết, hoặc thành phần của nó là một nguồn lợi thế cạnh tranh và rủi ro pháp lý.

Đáp lại, các cơ quan quản lý đã bắt đầu đưa ra các tiêu chuẩn tối thiểu về những gì các nhà phát triển AI phải ghi lại và công bố về dữ liệu được các mô hình của họ sử dụng.

Ví dụ, Đạo luật AI của EU yêu cầu các nhà cung cấp mô hình AI đa năng phải công bố “bản tóm tắt đủ chi tiết” về nội dung huấn luyện của họ, sử dụng mẫu do Văn phòng AI của Ủy ban Châu Âu công bố. Mẫu này yêu cầu một bản ghi chép có hệ thống về các nguồn dữ liệu chính của mô hình, bao gồm các tập dữ liệu lớn có sẵn công khai, dữ liệu được cấp phép từ chủ sở hữu bản quyền và dữ liệu được thu thập hoặc trích xuất từ ​​các nguồn trực tuyến. Tương tự, Đạo luật Minh bạch Dữ liệu Huấn luyện AI Tạo sinh của California yêu cầu các nhà phát triển phải công bố bản tóm tắt các tập dữ liệu được sử dụng để huấn luyện bất kỳ hệ thống AI tạo sinh nào được cung cấp cho người dân California.

Trong bối cảnh này, việc ghi nhận nguồn gốc liên quan đến việc kết nối các nguồn dữ liệu huấn luyện với một mô hình chứ không phải với một kết quả đầu ra cụ thể. Đó là sự khác biệt giữa việc trả lời “những nguồn nào đã giúp mô hình này có khả năng tạo ra đầu ra?” so với “mô hình này đã sử dụng những nguồn nào để tạo ra đầu ra này?”. Việc trả lời câu hỏi này đáp ứng các nhu cầu khác nhau so với các hình thức ghi nhận nguồn gốc khác được mô tả trong bài viết này, vốn thường tập trung vào việc kết nối đầu ra từ các mô hình với các nguồn được sử dụng để tạo ra chúng. Việc ghi nhận nguồn gốc ở cấp độ mô hình (thường được gọi đơn giản là “minh bạch” hoặc “công khai”) cho phép người tiêu dùng so sánh các hệ thống cạnh tranh, các cơ quan quản lý giám sát và thực thi quy định, và các nhà nghiên cứu đưa ra đánh giá cấp cao về các vấn đề như những thiên kiến và an toàn.

Hình thức ghi nhận nguồn gốc này thường được tóm tắt hơn là đủ chi tiết. Các bản tóm tắt có thể chỉ nêu tên riêng lẻ các tập dữ liệu lớn – chứ không phải tất cả – được công khai và các nguồn dữ liệu huấn luyện khác. Và nó thường được thực hiện với các ngoại lệ. Ví dụ, mẫu của EU cho phép các nhà cung cấp mô hình biên tập lại một số yếu tố mà họ có thể biện minh là bí mật thương mại.

Mặc dù chúng phục vụ các mục đích khác nhau, chúng tôi cho rằng việc xem xét việc ghi nhận nguồn gốc ở cấp độ đầu ra và cấp độ mô hình có liên quan với nhau là hữu ích. Thứ nhất, kiểu thiết kế nhận biết nguồn mà quy định cấp độ mô hình ngày càng khuyến khích, chẳng hạn như việc sử dụng dữ liệu huấn luyện được chọn lọc kỹ lưỡng hơn, cũng chính là điều giúp việc ghi nhận nguồn gốc ở cấp độ đầu ra tốt hơn trở nên khả thi (như chúng ta đã thảo luận trước đó trong bài viết này). Thứ hai, chúng tôi kỳ vọng các cơ quan quản lý sẽ phát triển các yêu cầu của họ đối với các hệ thống AI để bao gồm việc ghi nhận nguồn gốc ở cấp độ đầu ra. Vào tháng 6 năm 2026, Cơ quan Cạnh tranh và Thị trường của Vương quốc Anh đã áp đặt một yêu cầu về hành vi đối với Google, theo đó Google phải thực hiện các bước để đảm bảo nội dung tìm kiếm của mình được ghi nhận nguồn gốc rõ ràng và chính xác, cũng như công bố thông tin thân thiện với người dùng giải thích các phương pháp ghi nhận nguồn gốc của mình. (Tuy nhiên, cần lưu ý rằng chúng ta nên thận trọng với các quy định ghi nhận nguồn gốc quá khắt khe, khó khăn hoặc không thực tế, đặc biệt là đối với việc phát triển AI nguồn mở và phi thương mại, hoặc đối với việc sử dụng máy móc nói chung.)

4. Người dùng mong đợi sự ghi nhận nguồn gốc.

Sau khi thế hệ LLM đầu tiên nổi tiếng vì những "ảo giác", một hệ thống đưa ra kết quả một cách tự tin mà không ghi lại nguồn gốc của nó giờ đây bị coi là thiếu sót.

Người dùng mong muốn có thể nhấp chuột để xem tài liệu nguồn đằng sau một tuyên bố, và kỳ vọng đó định hình những gì được xây dựng. Đó là một phần lý do tại sao các hệ thống như Claude hiện trả về kết quả có liên kết trở lại các trang web và tệp người dùng đã được sử dụng.

Trong các thị trường được quản lý và nhạy cảm, kỳ vọng này đang dần chuyển từ sở thích của người tiêu dùng thành yêu cầu mua sắm. Người mua hệ thống AI trong các lĩnh vực như luật, y tế và tài chính ngày càng yêu cầu các bằng chứng có thể kiểm toán cho thấy kết quả đầu ra cụ thể dựa trên cơ sở nào, để đáp ứng các chế độ tuân thủ của riêng họ. Được thiết kế cho các chuyên gia y tế, OpenEvidence ghi nhận nguồn gốc của nó thông qua phương pháp tương tự như Claude, và cải thiện hơn nữa độ tin cậy bằng cách giới hạn các nguồn đó trong các tài liệu y khoa đã được kiểm duyệt.

Khi các cá nhân, doanh nghiệp và chính phủ thúc đẩy "AI tự chủ", các hệ thống hoạt động như một máy trộn mờ ám, trộn lẫn mọi thứ chúng tìm thấy một cách bừa bãi, sẽ là không đủ. Các lựa chọn kiến ​​trúc giúp kiểm soát mối quan hệ giữa hệ thống AI và dữ liệu—chẳng hạn như quyền truy cập được cấp phép, truy xuất liên kết liên đoàn và nhật ký truy xuất minh bạch—cũng chính là những lựa chọn làm cho việc ghi nhận nguồn gốc tốt hơn, đặc biệt là trong quá trình suy luận.

Cũng có áp lực từ phía nhà cung cấp dữ liệu. Mặc dù các thỏa thuận cấp phép dữ liệu có thể gây lo ngại cho những người quan tâm đến việc mở rộng không gian chung kỹ thuật số, nhưng chúng tạo ra các động lực thương mại và nghĩa vụ hợp đồng cho các công ty AI trong việc phát triển các phương tiện để xác định nguồn nào đã đóng góp vào kết quả đầu ra nào. ProRata sử dụng việc ghi nhận nguồn gốc làm cơ sở cho việc cấp phép và thanh toán (mặc dù phương pháp của họ không được công bố, khiến khó có thể biết họ thực sự đang làm gì hoặc độ chính xác của nó như thế nào); Comet Plus của Perplexity trả tiền cho các nhà xuất bản tham gia khi nội dung của họ được truy cập, trích dẫn trong câu trả lời hoặc được một tác nhân xử lý; và Index của Parallel sử dụng giá trị Shapley để khuyến khích người viết "xem nội dung của họ đáng giá bao nhiêu đối với các tác nhân AI".

Mặc dù các định dạng truyền thống như TASL vẫn đóng vai trò quan trọng, đặc biệt là trong quá trình suy luận, chúng ta nên cởi mở với các mô hình và tiêu chuẩn mới để trình bày thông tin ghi nhận nguồn gốc cho người dùng. Đối với các phương pháp được Shapley hỗ trợ, nghiên cứu của OpenMined cho thấy cách biểu đồ hoặc các tính năng thiết kế khác có thể trình bày đóng góp tương đối của nhiều nguồn vào một kết quả đầu ra tổng hợp duy nhất. Khung Ghi nhận Nguồn gốc của Wikimedia mô tả cách bao gồm số lượng tham chiếu, hoạt động của người đóng góp và lời kêu gọi hành động có thể hỗ trợ độ tin cậy của các phản hồi do AI tạo ra, và thúc đẩy người đóng góp và quyên góp cho các nguồn. Trong môi trường học thuật, những người tham gia hội thảo gần đây tại Cambridge đã nêu bật nhu cầu về các kết quả đầu ra phải trình bày thông tin như việc rút lại bài báo và các biểu hiện quan ngại khác.

Tiến về phía trước

Chúng ta không được quên rằng việc ghi nhận nguồn gốc là một yếu tố quan trọng của khế ước xã hội về chia sẻ. Bất kể máy móc tham gia như thế nào, việc nêu tên nguồn gốc của chúng ta duy trì mối liên hệ giữa một tác phẩm sáng tạo hoặc kiến ​​thức và những người đã tạo ra nó.

Mặc dù thực sự là một thách thức về mặt kỹ thuật, chúng tôi lạc quan rằng các hệ thống AI hiện đại có thể thực hành việc ghi nhận nguồn gốc một cách có ý nghĩa, đặc biệt nếu việc ghi nhận nguồn gốc được tích hợp ngay từ khâu thiết kế. Như bài viết này đã mô tả: kiến ​​trúc truy xuất giúp việc ghi nhận nguồn gốc trở nên khả thi; các phương pháp đóng góp tiên tiến hơn đang dần chuyển từ nghiên cứu sang ứng dụng thực tiễn; và áp lực từ phía thương mại, pháp lý và người dùng đang cùng hướng đến mục tiêu chung này.

Khi các phương pháp ghi nhận nguồn gốc trưởng thành, điều quan trọng đối với chúng ta là chúng cần được mở rộng đến những người sáng tạo, nhà xuất bản và người quản lý nội dung được cấp phép mở và thuộc phạm vi công cộng, thay vì chỉ dành riêng cho những người tham gia vào các thỏa thuận cấp phép hạn chế hoặc sử dụng công nghệ tinh vi để kiểm soát quyền truy cập vào nội dung của họ.

Cuối cùng, chúng ta không nên quên rằng việc ghi nhận nguồn gốc đúng cách là cần thiết nhưng chưa đủ cho tương lai của tài nguyên chung. Một người sáng tạo có thể được ghi nhận công lao nhưng vẫn mất đi lượng truy cập đã tài trợ cho công việc của họ. Một thư viện công cộng vẫn có thể bị quá tải bởi các máy móc truy cập ồ ạt vào bộ sưu tập của mình. Một cộng đồng như Wikipedia vẫn có thể mất đi kết nối với những người đóng góp, cả hiện tại và tiềm năng. Để xây dựng mối quan hệ tương hỗ thực sự giữa AI và tài nguyên chung, chúng ta cũng cần những ý tưởng mới táo bạo, cơ sở hạ tầng và các hình thức trao đổi để duy trì các cộng đồng và thể chế mà tài nguyên chung phụ thuộc vào.

Nếu bạn đang nghiên cứu về việc ghi nhận nguồn gốc tác giả, đặc biệt là việc xây dựng các hệ thống AI thực hiện việc này theo một số cách mà chúng tôi mô tả ở đây, CC rất muốn được nghe ý kiến ​​từ bạn.

Bài viết này của Jack Hardinges và Irina Bejan (OpenMined) được cấp phép theo CC BY 4.0. Xin cảm ơn Diyana Noory, Monica Granados và Sarah Pearson tại Creative Commons vì những nhận xét của họ về bản thảo bài viết này.

 

Tác giả: admin

Tổng số điểm của bài viết là: 0 trong 0 đánh giá

Click để đánh giá bài viết

  Ý kiến bạn đọc

GIÁO DỤC MỞ - TÀI NGUYÊN GIÁO DỤC MỞ: ỨNG DỤNG VÀ PHÁT TRIỂN

Trang Web này được thành lập theo Quyết định số 142/QĐ-HH do Chủ tịch Hiệp hội các trường đại học, cao đẳng Việt Nam – AVU&C (Association of Vietnam Universities and Colleges), GS.TS. Trần Hồng Quân ký ngày 16/09/2019, ngay trước thềm của Hội thảo ‘Xây dựng và khai thác tài nguyên giáo dục mở’ do 5...

Thống kê truy cập
  • Đang truy cập61
  • Máy chủ tìm kiếm11
  • Khách viếng thăm50
  • Hôm nay13,785
  • Tháng hiện tại1,109,112
  • Tổng lượt truy cập16,903,530
Bạn đã không sử dụng Site, Bấm vào đây để duy trì trạng thái đăng nhập. Thời gian chờ: 60 giây