
AI-ის დახმარებით საგვარეულო ხის კვლევა: დეველოპერის გამოცდილება
დეველოპერმა, რომელიც საგვარეულო ხეს AI ასისტენტის დახმარებით აშენებს, ახალი პოსტი გამოაქვეყნა. მან აღწერა, როგორ ამოწმებს მონაცემებს ოფიციალური ჩანაწერებით, როგორ ავტომატიზებს არქივების დათვალიერებას და რა შედეგი მისცა ხელნაწერის ამოკითხვის ცდებმა.
დეველოპერმა, რომელიც საგვარეულო ხეს AI ასისტენტის დახმარებით აშენებს, წინა პოსტის გაგრძელება გამოაქვეყნა. A Java Geek-ის ბლოგზე გამოქვეყნებულ ტექსტში ავტორი აღწერს, როგორ ამოწმებს ასისტენტის მიერ მოძიებულ მონაცემებს ოფიციალური ჩანაწერებით, როგორ ავტომატიზებს გენეალოგიური და საარქივო საიტების დათვალიერებას და რა შედეგი მისცა ძველი ხელნაწერების ამოკითხვის ცდებმა.
ნდობა და გადამოწმება
პირველი გაკვეთილი ჰალუცინაციას ეხება. ავტორი აღიარებს, რომ AI-ს პასუხის გამოგონება შეუძლია, თუმცა ეს პრეტენზია ნაკლებად მართებულია, როცა პასუხი რეალურ მონაცემებზეა დაფუძნებული. თავად გენეალოგიური საიტები კი სრულად სანდო წყაროები არ არიან. GEDCOM-ის, საგვარეულო მონაცემების სტანდარტული ფორმატის, ხარისხის ველი QUAY ოთხ დონეს განსაზღვრავს: 0 ნიშნავს არასანდო ან შეფასებით მონაცემს, 1 საეჭვო სანდოობას (ინტერვიუები, აღწერები, ზეპირი გადმოცემა), 2 მოვლენის შემდეგ ჩაწერილ მეორად მტკიცებულებას, 3 კი პირდაპირ და პირველად მტკიცებულებას.
გენეალოგიური საიტებიდან მოპოვებული მონაცემები QUAY 2-ით იწყება. თუ სამოქალაქო ან სამრევლო აქტი მას ადასტურებს, მონაცემი QUAY 3-ზე გადადის, წინააღმდეგ შემთხვევაში უგულებელყოფილია.
არქივების ავტომატიზაცია
საარქივო საიტები ორი პარამეტრით განსხვავდება: ღია წვდომაა თუ ანგარიში საჭიროა, და რამდენად მკაცრად ბლოკავს ბოტებს. ყველაზე სუსტი დაცვის საიტები curl-ით იკითხება, საშუალო დონისთვის სრული ბრაუზერია საჭირო, რომელსაც ავტორი Playwright-ით მართავს, ხოლო ყველაზე დაცული საიტები Cloudflare-ის ტიპის დაცვის უკანაა და იქ Chrome debug რეჟიმში ეშვება. ეს უკანასკნელი მიდგომა მყიფეა, რადგან ბრაუზერის დახურვა პროცესს აწყვეტს, ამიტომ უმეტეს საიტზე ავტორი Playwright-ს მდგრადი სესიის პროფილით ირჩევს: ერთხელ შედის სისტემაში, ხურავს ბრაუზერს და ასისტენტი შემდეგ იმავე წვდომით მუშაობს. ის ასევე აფრთხილებს, რომ ასისტენტისთვის საკუთარი მონაცემების მიცემა გონივრული ნაბიჯი არ არის.
ხელნაწერის ამოკითხვა
აქტების ტექსტად გადაქცევა მნიშვნელოვანია, სირთულე კი მწიგნობრის ხელწერაზე, ენის ცოდნასა და დოკუმენტის ასაკზეა დამოკიდებული. ასისტენტი ფრთხილად მუშაობდა: გამოცნობის ნაცვლად გაურკვეველი სიტყვის ჩანაცვლება აირჩია. სხვა ხელსაწყოებმა უარესად გაართვეს თავი: Transkribus-მა უაზრო ტექსტი დააბრუნა და, როგორც ავტორმა მოგვიანებით წაიკითხა, მომხმარებლის საკუთარ დოკუმენტებზე წვრთნა სჭირდება; kraken-ზე დაფუძნებულმა ლოკალურმა სისტემამ Transkribus-ს აჯობა, მაგრამ ასისტენტს ბევრად ჩამორჩა; ფრანგულმა Filae-მ კი ფრანგული ხელწერის ამოკითხვისას შესანიშნავი შედეგი მისცა, თუმცა სერვისი, როგორც ჩანს, გამორთულია.
რას მიაღწია პროექტმა
ავტორი ციკლსაც აღწერს: ოფიციალურ ჩანაწერებში ნაპოვნი ახალი წინაპრები მას გენეალოგიურ საიტებზე აბრუნებს, სადაც „ჭკვიანი დამთხვევის“ ალგორითმებს სხვების ხეებში უკვე არსებული ნათესავების მოძებნა შეუძლიათ. დამთხვევებს ის ფრთხილად ეკიდება, რადგან ერთ მცდარ დადასტურებას მთელი შტოს გაფუჭება შეუძლია, თუმცა ასე გვარის დაწერის ვარიანტებიც იძებნება. პროექტში ამჟამად 1200-ზე მეტი ადამიანი და ერთ შტოზე 13 თაობაა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.