Microsoft từng gọi việc huấn luyện AI là vụ đánh cắp lớn

Tài liệu nội bộ Microsoft cho thấy một lãnh đạo từng cảnh báo AI có thể làm suy yếu chính ngành nội dung đang cung cấp dữ liệu cho nó.

Microsoft từng gọi việc huấn luyện AI là vụ đánh cắp lớn

Một tài liệu nội bộ của Microsoft đang thu hút sự chú ý sau khi được đưa vào hồ sơ vụ kiện bản quyền giữa The New York Times, Microsoft và OpenAI. Trong bản ghi nhớ từ tháng 1/2023, Brent Hecht, Giám đốc khoa học ứng dụng của Microsoft, mô tả việc các mô hình ngôn ngữ lớn thu thập khối lượng nội dung khổng lồ trên Internet để phục vụ huấn luyện là một hình thức “đánh cắp” có quy mô chưa từng thấy. Nội dung này được New York Times sử dụng trong lập luận rằng các công ty AI đã nhận thức được những hệ quả đối với ngành sáng tạo và báo chí.

Brent Hecht, Giám đốc khoa học ứng dụng Microsoft, có những nhận xét đáng chú ý về tác động của việc thu thập dữ liệu để huấn luyện AI.

Điểm đáng chú ý là nhận xét trên xuất hiện trong bối cảnh Microsoft và OpenAI đang bảo vệ hoạt động huấn luyện AI bằng lập luận về “fair use”, tức một số trường hợp sử dụng tác phẩm có bản quyền có thể được pháp luật Mỹ cho phép. New York Times lại cho rằng việc sao chép hàng loạt nội dung báo chí để xây dựng mô hình AI không thể mặc nhiên được xem là sử dụng hợp lý. Những tài liệu vừa được công khai chưa phải phán quyết của tòa và các cáo buộc trong hồ sơ vẫn đang được tranh luận. Microsoft cũng cho rằng những nhận định của Hecht thể hiện quan điểm cá nhân, không phải lập trường pháp lý chính thức của công ty.

Tranh cãi không chỉ nằm ở chuyện AI sử dụng dữ liệu có bản quyền mà còn liên quan đến cách chatbot thay đổi dòng truy cập trên Internet. Theo tài liệu được New York Times trích dẫn, dữ liệu nội bộ Microsoft cho thấy công cụ trả lời bằng AI của Copilot có thời điểm khiến tỷ lệ người dùng nhấp vào nội dung trên nytimes.com giảm tới 93% so với tìm kiếm Bing truyền thống. Hecht cảnh báo đây có thể tạo thành một “vòng xoáy” khi AI lấy nội dung từ các website, nhưng lại khiến người dùng ít truy cập những website đó hơn, từ đó làm suy yếu nguồn cung dữ liệu mà chính các mô hình AI cần trong tương lai.

Nghịch lý này đặc biệt rõ với ngành báo chí. Các tòa soạn đầu tư nguồn lực để sản xuất tin tức, điều tra và nội dung chuyên sâu, trong khi chatbot có thể tổng hợp thông tin thành câu trả lời ngay trên giao diện mà người dùng không cần mở bài viết gốc. Hồ sơ vụ kiện cũng dẫn lại các trao đổi nội bộ của OpenAI về khả năng mô hình ngôn ngữ dự đoán và hoàn thành những câu trong bài viết của New York Times. Những tài liệu này đang được New York Times sử dụng để lập luận rằng AI không chỉ khai thác nội dung báo chí mà còn có khả năng làm thay đổi mô hình kinh tế vốn dựa nhiều vào lượng truy cập và quảng cáo.

AI có thể cung cấp câu trả lời trực tiếp, làm thay đổi cách người dùng tiếp cận các website và nội dung báo chí.

Ở một khía cạnh khác, vấn đề còn liên quan đến nội dung nằm sau tường phí. Trong lời khai được hồ sơ vụ kiện trích dẫn, CEO Microsoft Satya Nadella cho rằng nội dung bị khóa bằng paywall cần được cấp phép nếu được sử dụng để huấn luyện hoặc làm dữ liệu nền cho AI. Ông cũng cho biết nếu biết trước OpenAI sử dụng nội dung phía sau paywall để huấn luyện, Microsoft sẽ yêu cầu công ty này huấn luyện lại mô hình. Đây là điểm cho thấy ngay trong các công ty phát triển AI cũng tồn tại những tranh luận về ranh giới giữa dữ liệu công khai, dữ liệu có bản quyền và nội dung cần được cấp phép.

Vụ kiện giữa New York Times và Microsoft, OpenAI bắt đầu từ cuối năm 2023 và trở thành một trong những cuộc tranh chấp đáng chú ý nhất về bản quyền trong kỷ nguyên AI tạo sinh. Câu hỏi trung tâm vẫn là liệu việc thu thập và sử dụng tác phẩm có bản quyền để huấn luyện mô hình có thuộc phạm vi “fair use” hay không. Trong khi các công ty AI cho rằng quá trình này có thể được xem như việc học hỏi từ lượng lớn thông tin, các nhà xuất bản và nhiều nhóm sáng tạo lo ngại mô hình kinh doanh của họ bị ảnh hưởng khi chính nội dung họ sản xuất trở thành nguyên liệu cho những sản phẩm có khả năng thay thế một phần hoạt động truy cập trực tiếp. Những tài liệu mới công khai vì thế không chỉ làm nóng cuộc tranh luận pháp lý mà còn đặt ra câu hỏi lớn hơn về cách AI và Internet sẽ cùng tồn tại trong tương lai.

Bí mật phía sau key kích hoạt Windows XP nổi tiếng

Sau hai thập kỷ, cựu kỹ sư Microsoft David Plummer tiết lộ vì sao key FCKGW từng nổi tiếng với Windows XP, và bí mật không nằm ở riêng dãy ký tự.

Bí mật phía sau key kích hoạt Windows XP nổi tiếng

Hai thập kỷ sau thời kỳ Windows XP thống trị máy tính cá nhân, một dãy ký tự vẫn được nhiều người nhớ đến như biểu tượng của thời đại phần mềm lậu: FCKGW-RHQQ2-YXRKT-8TG6W-2B7Q8. Tuy nhiên, theo David Plummer, cựu kỹ sư Microsoft từng tham gia xây dựng Windows Product Activation (WPA), bản thân product key này không phải một “chìa khóa vạn năng” có khả năng phá cơ chế kích hoạt. Điều khiến nó hoạt động nằm ở sự kết hợp giữa key và một thành phần đặc biệt được Microsoft đưa vào bộ cài đặt dành cho khách hàng doanh nghiệp.

Microsoft lập kỷ lục với bản vá gần 1000 lỗ hổng bảo mật

Bản vá lỗi định kỳ lập kỷ lục cho thấy hiệu suất của các công cụ AI tìm lỗ hổng bảo mật và cũng cho thấy Hệ điều hành Windows của Microsoft đầy rẫy nguy cơ.

Microsoft lập kỷ lục với bản vá gần 1000 lỗ hổng bảo mật

Microsoft đã lập kỷ lục mới trong ngày vá lỗi Patch Tuesday khi công bố khắc phục tới 974 lỗ hổng bảo mật trên toàn bộ danh mục phần mềm của mình vào thứ Ba vừa qua, trong đó có hai lỗ hổng được xác nhận đã bị khai thác tích cực ngoài thực tế.

Cụ thể, có 723 lỗ hổng trên Windows, 111 trên Office và Office 2016, 62 trên SQL và 22 trên Developer Tools. Trong số này, hơn 110 lỗ hổng được đánh giá ở mức nghiêm trọng.

Microsoft siết quy tắc để AI không thể tự vượt quyền

Microsoft đề xuất bộ quy tắc mới nhằm giữ quyền kiểm soát AI trong tay con người.

Microsoft siết quy tắc để AI không thể tự vượt quyền

Microsoft ngày 14/9 công bố dự thảo bộ quy tắc ứng xử dành cho các mô hình trí tuệ nhân tạo trong tương lai, tập trung vào một nguyên tắc cốt lõi: dù AI có thể đạt năng lực xử lý ngày càng cao, quyền kiểm soát cuối cùng vẫn phải thuộc về con người. Khung quy tắc được xây dựng trong định hướng mà Microsoft gọi là “trí tuệ nhân tạo nhân văn”, với mục tiêu duy trì AI như một công cụ hữu ích, có giới hạn và chịu sự giám sát thực chất. Đáng chú ý, Microsoft dự báo các hệ thống siêu trí tuệ có thể vượt con người ở phần lớn tác vụ trong vòng một thập kỷ tới, qua đó đặt ra yêu cầu phải thiết lập rào cản kỹ thuật từ sớm.

Đọc nhiều nhất

Tin mới