
Data Provenance Initiative-ის ბოლო კვლევამ, MIT-ის ხელმძღვანელობით ჩატარებულმა კვლევითმა ჯგუფმა, გამოავლინა მზარდი კრიზისი მონაცემების ხელმისაწვდომობაში, რომლებიც გამოიყენება ხელოვნური ინტელექტის (AI) მოდელების მოსამზადებლად. კვლევა, რომელიც შეისწავლა 14,000 ვებ დომენი შედის სამ ხშირად გამოყენებულ კატეგორიაში AI ტრენინგის მონაცემთა ნაკრებებმა აჩვენა, რომ მაღალი ხარისხის მონაცემთა წყაროების მნიშვნელოვანი ნაწილი ამჟამად ზღუდავს წვდომას მათ კონტენტზე.
კვლევის თანახმად, C4, RefinedWeb და Dolma მონაცემთა ნაკრებებში შეზღუდულია ყველა მონაცემის დაახლოებით 5% და უმაღლესი ხარისხის წყაროებიდან მიღებული მონაცემების 25% . ეს შეზღუდვები, ძირითადად, ხორციელდება Robots Exclusion Protocol-ის მეშვეობით , რომელიც ვებსაიტების მფლობელებისთვის დიდი ხნის მეთოდია, რათა თავიდან აიცილონ ავტომატური ბოტების მიერ მათი გვერდების სკანირება robots.txt ფაილის გამოყენებით.
წამყვანი ავტორი შეინ ლონგპრი აფრთხილებს: „ჩვენ ვხედავთ ინტერნეტში მონაცემების გამოყენებაზე თანხმობის სწრაფ შემცირებას, რასაც შედეგები მოჰყვება არა მხოლოდ...“ AI კომპანიებისთვის, არამედ მკვლევარებისთვის, აკადემიკოსებისთვის და არაკომერციული ორგანიზაციებისთვის.“ ამ ტენდენციამ შეიძლება მნიშვნელოვნად იმოქმედოს განვითარებასა და გაუმჯობესებაზე AI მოდელები, რომლებიც დიდწილად ეყრდნობიან მრავალფეროვან, მაღალხარისხიან მონაცემებს ტრენინგისთვის.
ტრენინგის მონაცემების სიმწირე კრიტიკულ პრობლემად იქცევა AI ინდუსტრია. როგორც AI სისტემები უფრო დახვეწილი ხდება და სულ უფრო კომპლექსური ამოცანებისთვის გამოიყენება, მდიდარი და მრავალფეროვანი მონაცემთა ნაკრებების მოთხოვნა იზრდება. თუმცა, ასეთი მონაცემების მიწოდება სხვადასხვა ფაქტორების გამო მცირდება, მათ შორის კონფიდენციალურობის შეშფოთება, ეთიკური მოსაზრებები და უკან დაბრუნება შინაარსის შემქმნელები.

ბევრმა გამომცემელმა და ონლაინ პლატფორმამ გადადგა ნაბიჯები მათი მონაცემების ნებართვის გარეშე შეგროვებისგან დასაცავად. ზოგს აქვს დააყენეთ paywalls ან შეცვალეთ მათი მომსახურების პირობები მათი კონტენტის გამოყენების შეზღუდვის მიზნით AI ტრენინგი. სხვებმა, როგორიცაა Reddit-ი და StackOverflow-ი, დაიწყეს დატენვა AI კომპანიები მათ მონაცემებზე წვდომისთვის. ასევე განხორციელდა სამართლებრივი ქმედებები, The New York Times-მა უჩივლა Open-სAI და Microsoft-ს საავტორო უფლებების სავარაუდო დარღვევისთვის, რომელიც დაკავშირებულია საინფორმაციო სტატიების გამოყენებასთან AI სასწავლო.
ამ მონაცემთა სიმწირის შედეგები შორსმიმავალია. AI არასაკმარის ან მიკერძოებულ მონაცემებზე დაფუძნებულმა მოდელებმა შეიძლება განიცადონ შემცირებული სიზუსტე, შეზღუდული განზოგადების უნარი და ახალ სიტუაციებთან ადაპტაციის უუნარობა. ამან შესაძლოა შეანელოს ინოვაციები ამ სფეროში და ხელი შეუშალოს ახლის განვითარებას. AI განაცხადების.
ამ გამოწვევების გადასაჭრელად, მკვლევარებმა და AI კომპანიები ალტერნატიულ მიდგომებს იკვლევენ. ესენია აქტიური სწავლების ტექნიკა, რომელიც ფოკუსირებულია ტრენინგისთვის ყველაზე ინფორმაციული მონაცემთა წერტილების შერჩევაზე და სწავლების გადაცემა, რომელიც იყენებს ცოდნას წინასწარ მომზადებული მოდელები ახალი ამოცანების შესრულების გასაუმჯობესებლად შეზღუდული მონაცემებით.
ზოგიერთი კომპანია ასევე დებს გარიგებებს გამომცემლებთან, რათა უზრუნველყოს მათ კონტენტზე მუდმივი წვდომა. მაგალითად, OpenAI-მ, Google-მა და Meta-მ ცოტა ხნის წინ დადეს შეთანხმებები ისეთ საინფორმაციო ორგანიზაციებთან , როგორიცაა The Associated Press და News Corp, რათა უზრუნველყონ მაღალი ხარისხის სასწავლო მონაცემების უწყვეტი ნაკადი.
როგორც AI ვინაიდან ინდუსტრია ებრძვის ამ ახალ მონაცემთა კრიზისს, შესაძლოა, ის იძულებული გახდეს შეიმუშაოს ტრენინგის მოდელების უფრო ეფექტური და პასუხისმგებლიანი გზები. ამან შეიძლება გამოიწვიოს ინოვაციები მონაცემთა შეგროვებასა და გამოყენებაში და სრულიად ახალი სასწავლო პარადიგმების შექმნაც კი, რომლებიც ნაკლებად იქნება დამოკიდებული მასიურ მონაცემთა ნაკრებებზე.
ის შესწავლა's დასკვნები ხაზს უსვამს დაბალანსებული მიდგომის აუცილებლობას AI განვითარება, რომელიც პატივს სცემს ინტელექტუალური საკუთრების უფლებებსა და კონფიდენციალურობის საკითხებს, ამავდროულად ხელს უწყობს ინოვაციებს. როგორც ლანდშაფტი AI ტრენინგის მონაცემები აგრძელებს განვითარებას, ტექნოლოგიურ კომპანიებს, კონტენტის შემქმნელებსა და პოლიტიკის შემქმნელებს შორის თანამშრომლობა გადამწყვეტი იქნება ამ გამოწვევებთან გამკლავებისა და მდგრადი ზრდის უზრუნველყოფისთვის. AI ტექნოლოგიები.


