Hôm nay, X – trước đây là Twitter, đã cập nhật các điều khoản dịch vụ của mình để cấm việc crawling và scraping – có lẽ để đề phòng bất kỳ mô hình trí tuệ nhân tạo (AI) nào đào tạo dữ liệu của nó.
Các điều khoản mới, có hiệu lực từ ngày 29 tháng 9, cấm bất kỳ hình thức crawling hoặc scraping nào mà không có “sự đồng ý bằng văn bản trước đó”. Phiên bản trước của các điều khoản cho phép crawling phù hợp với robots.txt.
“Chú ý: việc crawling các Dịch vụ là được phép nếu được thực hiện theo các quy định của tệp robots.txt, tuy nhiên, việc scraping các Dịch vụ mà không có sự đồng ý trước đó của chúng tôi là bị cấm đặc biệt”, nó nói.
Trong vài tháng gần đây, Twitter cũng đã thay đổi tệp robots.txt của mình – một tệp cung cấp các hướng dẫn cho robot crawler về phần nào của trang web mà chúng được phép truy cập – để loại bỏ các hướng dẫn cho tất cả các robot crawler ngoại trừ Google.
Vào năm 2015, Twitter xác nhận rằng họ có một thỏa thuận “firehose” với Google để hiển thị tweets trong kết quả tìm kiếm. Tuy không rõ thay đổi gì trong tính chất hoặc điều khoản của thỏa thuận đó dưới quản lý mới.
Chúng tôi đã liên hệ với Google để hiểu xem công ty tìm kiếm có thỏa thuận nào hay không. Chúng tôi sẽ cập nhật câu chuyện nếu chúng tôi nhận được phản hồi.
Ngoài ra, X cũng đã thay đổi tệp robots.txt để không cho phép các crawler lấy thông tin như số lượt thích và retweet liên quan đến các bài đăng cụ thể. Nó cũng ngăn chặn robot xem số lượt thích, phương tiện và hình ảnh của một tài khoản.
Vào tháng 6, mạng xã hội này tạm thời ngăn người dùng không đăng nhập xem các bài đăng. Một vài ngày sau đó, họ đã loại bỏ yêu cầu đăng nhập để xem tweets. Vào thời điểm đó, Musk đã nói rằng đó là một biện pháp tạm thời vì trang web bị “lũ dữ liệu” đào cắt đến mức gây suy giảm dịch vụ cho người dùng bình thường.
Musk đã phản đối việc các công ty crawl dữ liệu Twitter/X để đào tạo mô hình trí tuệ nhân tạo. Vào tháng 4, ông đã đe dọa kiện Microsoft vì sử dụng trái phép dữ liệu mạng xã hội này để đào tạo mô hình trí tuệ nhân tạo. Vào tháng 7, ông đã khởi kiện sưu tầm dữ liệu đối với các công ty không xác định.
Vào đầu tháng này, X đã thay đổi chính sách bảo mật để nêu rõ rằng nó có thể sử dụng dữ liệu công khai để đào tạo mô hình trí tuệ nhân tạo. Musk đã từng nhấn mạnh trong một không gian Twitter rằng xAI, một công ty được thành lập vào tháng 7, sẽ sử dụng dữ liệu công khai như các tweet để đào tạo mô hình của mình. Chính sách bảo mật mới của X cũng có quy định về việc thu thập dữ liệu sinh trắc học của người dùng cùng với lịch sử giáo dục và công việc. #X #Twitter #TermsOfService #Crawling #Scraping #AI #DataTraining #Banned #Robots.txt #Google #PrivacyPolicy #DataUsage #PublicData #AIModels #DataScraping #Lawsuit #ElonMusk #Microsoft #xAI #BiometricData
Nguồn: https://techcrunch.com/2023/09/08/x-updates-its-terms-to-ban-crawling-and-scraping/
Elon Musk-owned X, formerly Twitter, has updated its terms of service to prohibit scraping and crawling — likely to fend off any AI models training on its data.
The new terms, which are effective from September 29, ban any kind of scraping or crawling without “prior written consent.”
NOTE: crawling or scraping the Services in any form, for any purpose without our prior written consent is expressly prohibited.
The previous version of the terms allowed crawling in accordance with robots.txt.
“NOTE: crawling the Services is permissible if done in accordance with the provisions of the robots.txt file, however, scraping the Services without our prior consent is expressly prohibited,” it read.
In the last few months, Twitter has also altered its robots.txt file — a file that gives instructions to robot crawlers about what parts of the site they are permitted to visit — to remove instructions for all crawler bots apart from Google.
In 2015, Twitter confirmed that it had a firehose deal in place with Google to surface tweets in search results. It is not clear if the nature or terms of that deal have changed under the new management.
We have reached out to Google to understand if the search giant has an agreement in place. We will update the story if we hear back.
X has also altered the robots.txt file to disallow crawlers to get information such as likes and retweets related to specific posts. It also bars robots to look at an account’s likes, media, and photos
In June, the social network briefly stopped logged-out users from looking at posts. Days later, it removed the login requirement to view tweets. At that time, Musk had said that it was a temporary measure because the site was getting “data pillaged so much that it was degrading service for normal users.”
Musk has been against companies scraping Twitter/X data to train AI models. In April, he threatened to sue Microsoft for illegally using the social network’s data to train AI models In July, he filed a scraping lawsuit against unknown companies.
Earlier this month, X changed its privacy policy to state it might use public data to train AI models. Musk has previously noted during a Twitter space that xAI, a company founded in July, would use public data such as tweets to train its models. X’s new privacy policy also has provisions for the collection of biometric data of users along with education and job history.