Strona 1 z 2

Skanoteka - indeksowanie zespołów sądowych przez AI

: sob 21 lut 2026, 15:02
autor: Michał_Zieliński
Miło mi ogłosić, że wprowadziliśmy w Skanotece tagowanie (indeksowanie) akt sądowych przez sztuczną inteligencję - AI, a do tego udostępniamy robioną przy okazji przez AI pełną transliterację i tłumaczenie wpisów. :D

Jednostki już dostępne
W ramach testów zostało obrobionych całościowo 5 jednostek:
- księga grodzka płocka: https://skanoteka.genealodzy.pl/id1669-sy141-se1
- księga grodzka nurska:https://skanoteka.genealodzy.pl/id4652-sy29-se4
- księga grodzka ciechanowska: https://skanoteka.genealodzy.pl/id1671-sy163-se1
- księga wójtowsko-ławnicza gminy Krowodrza: https://skanoteka.genealodzy.pl/id3428-sy4-se
- księga wójtowsko-ławnicza jurydyki Grabary: https://skanoteka.genealodzy.pl/id3059-sy46-se31

Jak korzystać
Przy tagach zrobionych przez AI pojawia się ikonka AI. Dla przypomnienia: tagi obejmują osoby (imię i nazwisko) i miejscowości i są przeszukiwalne z poziomu zespołu, z poziomu typu dokumentów (sądowe) oraz z poziomu całej Skanoteki.

W przypadku skanów obrobionych przez AI w prawym dolnym rogu pojawia się ikona „Pokaż tłumaczenie”. Po jej naciśnięciu podświetlają się zaznaczenia wpisów. Po kliknięciu na dany wpis wyświetli się jego transliteracja i tłumaczenie.

Co trzeba mieć na uwadze korzystając z tagów i tłumaczeń?
Mogą zawierać błędy, czasem istotne – jest to nieuniknione na tym etapie rozwoju AI. Jednocześnie jesteśmy realistami i wiemy, że weryfikacja tagów przed ich publikacją, na masową skalę (a na taką skalę chcemy obrabiać księgi), nie mówiąc o weryfikacji transliteracji i tłumaczeń, jest nie do osiągnięcia: nie ma do tego wystarczająco dużo chętnych, z odpowiednią wiedzą (tłumaczenia). Dlatego wolimy już teraz udostępnić coś, co w dużej części jest prawidłowe, choć może zawierać błędy, niż czekać na ideał, którego osiągnięcie w praktyce będzie albo niemożliwe, albo będzie trwało latami.

Tagi można weryfikować: po zauważeniu błędu każdy zalogowany użytkownik może wprowadzić tag z prawidłowymi danymi („błędny” tag AI zostanie, użytkownicy nie mogą ich usuwać). Tagi AI jak i transliteracje i tłumaczenia mogą być w przyszłości przetworzone ponownie. Nowe tagi AI zastąpią wyłącznie tagi AI (tagi użytkowników nie będą usuwane ani nadpisywane).

Jak będziemy działać dalej, co będzie obrabiane?
Na początek bardzo istotna uwaga: OBRÓBKA AI NIE DOTYCZY AKT METRYKALNYCH. Z nimi AI sobie nie radzi (brak kontekstu) – pewien poziom błędów akceptowalny przy księgach sądowych, jest zupełnie nie do zaakceptowania przy metrykach - będą indeksowane jak dotychczas do Geneteki, nic się tu nie zmienia.
Na teraz obróbka dotyczy wyłącznie ksiąg sądowych (grodzkie, ziemskie, ławnicze, wiejskie, gruntowe, ewentualnie inne).

Jak wygląda obróbka?
Aby AI mogło zacząć swoją pracę, trzeba najpierw zaznaczyć ręcznie każdy tekst, który stanowi całość [to te kolorowe prostokąty, widoczne po wciśnięciu przycisku "Pokaż tłumaczenie" - możecie sprawdzić np. tu: https://skanoteka.genealodzy.pl/index.p ... ik=137.jpg ]. AI sobie z tym nie radzi, musimy to zrobić my. Jest to niezwykle proste, choć żmudne i czasochłonne (ze względu na ilość) zajęcie. Naszym celem jest przetłumaczenie wszystkich zespołów sądowych, jakie są (lub będą) w Skanotece. Nie chcemy więc robić pojedynczych ksiąg z różnych zespołów, tylko obrabiać je „blokami”, aby dostarczać efektywny wynik. Potrzebujemy więc Waszej pomocy – ochotników, którzy, będą oznaczali skany tymi „prostokątami”, co umożliwi ich obróbkę przez AI. Dodatkowo do każdego zespolu trzeba stworzyć listę nazwisk i miejscowości, które najczęściej występują w danym rejonie/zespole (to zmniejsza liczbę błędów).
Będziemy ogłaszać „nabory” na wybrane części zespołów ksiąg sądowych: tutaj, na profilu FB Skanoteki, w Grupie Skanoteka – obróbka AI na FB.
Oczywiście wszystko wytłumaczymy, choć podkreślam – samo zajęcie jest banalnie proste i wymaga tylko dostępu do Internetu.
Zapraszamy Was do wyboru pierwszej większej grupy ksiąg (10 jednostek), którą poddamy obróbce: ankieta jest dostępna powyżej, trwa 5 dni! Oczywiście pamiętajcie, że oprócz zagłosowania, potrzebujemy ochotników, którzy księgi oznaczą;-).

Koszt
Obróbka skanów przez AI (odczytywanie tekstu, transliteracja, tłumaczenie, tagi) jest płatną usługą (korzystamy z Gemini). Ten koszt ponosi PTG. Biorąc pod uwagę zamierzoną skalę obróbki – koszt będzie bardzo wysoki. Na początek, m.in. dzięki hojnemu wsparciu w postaci darowizn i przede wszystkim 1,5% przekazanemu w zeszłym roku – stać nas na to. Nie wiemy czy tak będzie mogło być cały czas – nie wykluczamy przeprowadzania np. zbiórek celowych na obróbkę konkretnych partii. To zależy od tego, jakie będą koszty przy obróbce na większą skalę. Tak więc proszę pamiętajcie o nas przy rozliczeniu PITa rocznego w tym roku i kolejnym latach, bo to na pewno pozwoli nam finansować w większym zakresie obróbkę AI.
Finalny produkt, jak zawsze u nas, będzie dostępny dla wszystkich, za darmo w Skanotece.

Zapraszamy do udziału w ankiecie, korzystania, włączajcie się w obróbkę skanów, weryfikację i poprawianie tagów, no i wesprzyjcie nas swoim 1,5% w tym roku!

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: ndz 22 lut 2026, 17:11
autor: Kołakowski_Jerzy
Czy tylko księgi umieszczone w SKANOTECE będą indeksowane?

Jerzy Kołakowski

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: ndz 22 lut 2026, 19:33
autor: Pawłowska_Ledke_Elżbieta
Michale!

Genialne. Bardzo dziękujemy.

Elżbieta

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: ndz 22 lut 2026, 20:48
autor: Michał_Zieliński
Kołakowski_Jerzy pisze: ndz 22 lut 2026, 17:11 Czy tylko księgi umieszczone w SKANOTECE będą indeksowane?

Jerzy Kołakowski
Tak - tagowanie dotyczy tylko ksiąg ze Skanoteki.

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: ndz 22 lut 2026, 21:56
autor: sirdaniel
Coś pięknego, brawo.

Czy na pewno obróbka akt metrykalnych jest tak słaba? Może zostawić Ai dekodowanie samych imion i nazwisk, wydaje mi się to działa, zarówno a aktach tabelarycznych jak i opisowych. Ale może szkoda uruchamiać Ai tylko do częściowej obróbki?

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: pn 23 lut 2026, 08:51
autor: Rokdar
Niesamowite! :D

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: pn 23 lut 2026, 15:40
autor: rafal_rr
sirdaniel pisze: ndz 22 lut 2026, 21:56 Coś pięknego, brawo.

Czy na pewno obróbka akt metrykalnych jest tak słaba? Może zostawić Ai dekodowanie samych imion i nazwisk, wydaje mi się to działa, zarówno a aktach tabelarycznych jak i opisowych. Ale może szkoda uruchamiać Ai tylko do częściowej obróbki?
Ja kiedyś próbowałem kilka aktów roczytać za pomocą gemini. Lata 30 XX wieku, pismo czytelne. AI sobie radził dosłownie z niemal każdym słowem poza imieniem, nazwiskiem, wiekiem i nazwą miejscowości :D
Ale postęp w tej materii następuje z dnia na dzień, mam nadzieję, że już niedługo jakość będzie o wiele lepsza
Pozdrawiam,
Rafał

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: pn 23 lut 2026, 18:42
autor: semux
Testuję różne modele AI do odczytywania pisma odręcznego i Gemini nie ma tu konkurencji, robi to najlepiej, choć nie idealnie, ale postęp jest z wersji na wersję.

Oto test najnowszego modelu Gemini 3.1 Pro z ustawieniem media resolution ma high.
Poniżej 3 akty urodzeń z Piotrkowa Trybunalskiego z roku 1857, każdy wycięty (bo tak AI najlepiej rozpoznaje).
Dla każdego tekst rozpoznany przez AI i uwagi AI.

Akt 1.
Nazwisko chrzestnego odczytał jako Rotesgruben, a pewnie powinno być Rotengruber.

Akt 2.
Nieprawidłowo rozpoznane nazwisko matki zamiast Hentz lub Hintz rozpoznał Flasz.
Nazwisko świadka rozpoznał jako Wotka - podejrzewam, że powinno być Wołka, ale i mi to trudno odczytać.

Akt 3.
Tu nazwisko matki odczytał jako Ciecyk, a powinno być Piecyk, ale to P jest pisane jakoś dziwnie.

Przy okazji rozpoznawania tekstu AI dostał zadanie przygotowania do indeksu (i nawet więcej) i po przejrzeniu Na 20 aktów, zawsze dobrze rozpoznał daty, wiek i imiona.

Pomyłki dotyczą nazwisk (po prawej prawidłowe nazwisko) oto pomyłki w nazwiskach rodziców, świadków i chrzestnych w aktach od 4 do 20:
Grzybysz -> Przybysz
Wawrzyniak -> Woszczyniak
Musiński -> Muszyński
Bartyniak -> Bartysiak
Skoryciński -> Koryciński
Laska -> Lasota
Banaszak -> Banaszczak
Łyszkowski -> Łyczkowski
Łęcka -> Łącka (ale sam nie wiem czy na pewno)
Walerińska -> Walesińska
Gąsior -> Gajos
Jex -> Jeż
Tkacz -> Kautz lub Kantz

Nawet jak źle odczyta nazwisko to często jest ono zbliżone do prawidłowego.

Odczytanie treści z 313 aktów kosztowało mnie ok.17zł co jest dość sporym kosztem, ale gdyby zrobił to bezbłędnie - to akceptowalnym.

Wg mnie modele AI, to jest przyszłość dla masowej indeksacji dokumentów genealogicznych, jeszcze nie dziś, ale za rok-dwa.

Tu skany i rozpoznane treści:
Skan aktu nr 1
Obrazek
https://zapodaj.net/plik-JXmL6EMEKi


Treść rozpoznana przez AI do aktu 1:
[NA MARGINESIE: Piotrków 1]
Akta Urodzonych na 1857 roku
Działo się w Mieście Piotrkowie dnia pierwszego Stycznia tysiąc
ośmset pięćdziesiąt siódmego roku, o godzinie trzeciej po południu. Sta-
wił się Franciszek Dąbrowski, siodlarz w Piotrkowie zamieszka-
ły, lat dwadzieścia cztery liczący, w obecności Andrzeja Do-
browolskiego lat siedmdziesiąt cztery, i Józefa Śliwińskiego lat
czterdzieści pięć liczących sług Kościelnych w Piotrkowie zamiesz-
kałych, i okazał nam dziecię płci męzkiej urodzone w Piotrko-
wie dnia dwudziestego dziewiątego Grudnia roku zeszłego,
o godzinie czwartej rano, z jego małżonki Anny z Majewskich
lat dwadzieścia liczącej. Dziecięciu temu na Chrzcie świętym
w dniu dzisiejszym odbytym, nadane zostało imię Karol, a
Rodzicami jego Chrzestnemi byli Jan Rotesgruben i Anna
Piotrowska. Akt ten stawającemu i świadkom przeczytany
przez nich nie podpisany, gdyż pisać nie umieją. -
Ks. Jakubowski [?]
Uwagi AI:
Data urodzenia to 29 grudnia 'roku zeszłego', co w kontekście daty aktu (1 stycznia 1857) oznacza rok 1856. Nazwisko ojca chrzestnego odczytano jako 'Rotesgruben', choć końcówka jest lekko zamazana. Zachowano oryginalną pisownię słów takich jak 'męzkiej' czy 'siedmdziesiąt'.

Skan aktu nr 2
Obrazek
https://zapodaj.net/plik-KFD2BzPOcU


Treść rozpoznana przez AI do aktu 2:
[NA MARGINESIE: Piotrków
2.]
Działo się w Mieście Piotrkowie dnia pierwszego Stycznia
tysiąc ośmset pięćdziesiąt siódmego roku. o godzinie czwartej
popołudniu. Stawiła się Małgorzata Błach wyrobnica
z Piotrkowa lat dwadzieścia ośm mająca, w obecności Ada-
ma Magiery lat dwadzieścia dwa i Benedykta Wotka
lat trzydzieści liczących, obudwu w Piotrkowie zamiesz-
kałych.. i okazała nam dziecię płci żeńskiej urodzone
w Piotrkowie dnia dwudziestego szóstego Grudnia roku
zeszłego, o godzinie jedenastej w nocy z Maryanny Flasz
służącej, wolnej lat trzydzieści mającej. Dziecięciu temu
na Chrzcie świętym w dniu dzisiejszym odbytym nada-
ne zostało imię Małgorzata - a Rodzicami jego Chrzest-
nemi byli Adam Magiera i Małgorzata Błach. Akt
ten stawiającej i świadkom przeczytany, przez nich nie
podpisany, gdyż pisać nie umieją. - Ks. Jakubowski
Uwagi AI:
Dziecko nieślubne (matka określona jako 'wolna'), zgłoszone przez wyrobnicę Małgorzatę Błach. Nazwisko matki odczytano jako 'Flasz', jednak zapis może być interpretowany również jako 'Flesz'. Brak danych ojca, dlatego sekcja 'ojciec' została pominięta.
Skan aktu nr 3
Obrazek
https://zapodaj.net/plik-hoc46sBsyV


Treść rozpoznana przez AI do aktu 3:
[NA MARGINESIE: Piotrków
3.]
Działo się w Mieście Piotrkowie dnia pierwszego
Stycznia tysiąc ośmset pięćdziesiąt siódmego roku, o go-
dzinie czwartej po południu. Stawiła się Rozalia Wróblew-
ska wyrobnica wdowa z Piotrkowa lat sześćdziesiąt
mająca, w obecności Szymona Mankiewicza lat trzydzieści
pięć, i Wincentego Wróbla lat dwadzieścia siedm liczą-
cych wyrobników w Piotrkowie zamieszkałych, i okaza-
ła nam dziecię płci męzkiej urodzone w Piotrkowie
dnia dwudziestego dziewiątego Grudnia roku zeszłe-
go, o godzinie siódmej rano z Jadwigi Ciecyk od lat
kilku wdowy lat czterdzieści mającej. Dziecięciu
temu na Chrzcie świętym w dniu dzisiejszym odby-
tym nadane zostało imie Baltazar, a Rodzi-
cami jego chrzestnemi byli Szymon Man-
kiewicz i Magdalena Rogala. Akt ten sta-
wającej i świadkom przeczytany, a że pisać
nie umieją, przez nas tylko podpisany zo-
stał. -
Ks. Jakóbowski[?]
Uwagi AI:
Dziecko urodzone z matki wdowy (Jadwigi Ciecyk), ojciec nieznany. Akt zgłosiła osoba trzecia - Rozalia Wróblewska (wyrobnica, wdowa). Nazwisko dziecka w strukturze JSON przyjęto po matce. Podpis księdza na końcu aktu jest trudny do jednoznacznego odczytania, prawdopodobnie 'Ks. Jakóbowski' lub 'Jakubowski'.
Pozdrawiam
Sergiusz

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: pn 23 lut 2026, 19:36
autor: Jan.Pacek
semux pisze: pn 23 lut 2026, 18:42 ... zawsze dobrze rozpoznał daty, wiek i imiona.
Pomyłki dotyczą nazwisk
Nawet jak źle odczyta nazwisko to często jest ono zbliżone do prawidłowego.
Sergiusz
Czyli rozpoznał dobrze cyfry i liczby, a najważniejsze - czyli nazwisko - nie potrafi.
Laska -> Lasota
Gąsior -> Gajos
Tkacz -> Kautz lub Kantz
Przecież to jest takie samo dno jak wyszukiwanie polskich nazwisk w metrykach na familysearch zindeksowanych przez amerykanów.
Znajdę tam Laska i Lasota jak wpiszę w wyszukiwarce las*
Znajdę Gąsior i Gajos jak wpiszę ga*
Znajdę Tkacz i Kautz jak wpiszę *ka*
* - czyli gwiazdka w wyszukiwarce fs jest podstawowym znakiem przy szukaniu nazwisk i imion.
I to samo przy pomocy AI?
I jeszcze mam za to płacić? Na fs jest za darmo...
Dziękuję, postoję...

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: wt 24 lut 2026, 07:56
autor: skapska_honorata
To jest cudo. Pozdrawiam Honorata

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: wt 24 lut 2026, 13:47
autor: Bartek_M
Uprzedzając pytania o błędy w otagowaniu i tłumaczeniu księgi płockiej: tak, ta księga wypadła w indeksacji najsłabiej.

Po pierwsze dlatego, że w jej przypadku AI nie otrzymała wsparcia w postaci pomocniczej listy nazwisk szlachty.

Po drugie dlatego, że na 52 pierwszych stronach księgi zapisy nie posiadają nagłówków, które ułatwiają pracę AI - na tych stronach błędów jest najwięcej.

Po trzecie: Gemini średnio sobie radzi z tym akurat pismem, miesza czasem et z olim, myli relacje rodzinne (np. siostrę z żoną, w tłumaczeniach bratanka z pasierbem). A ponieważ (chyba od wersji 3.1) Gemini jest już świadom niektórych swych ograniczeń (Assessing Transcription Limitations!), to w trybie Pro trzeba się trochę namęczyć, by zmusić go do transliteracji takich zapisów. Zarzeka się, że sobie nie radzi, potem coś z siebie wydusi, ale na koniec odsyła do żywego paleografa łacińskiego albo proponuje lekturę podręczników paleografii.

A skoro macie już paleografa ;) na forum, pokusiłem się o korektę transliteracji przykładowego zapisu z księgi płockiej.

https://skanoteka.genealodzy.pl/index.p ... &zoom=5.04

Zapis #311: Quietatio Sajewski Trzciński

Ludzką korektę przeprowadziłem na transliteracji ze Skanoteki (czyli wykonanej jeszcze przez Gemini 3.0 tryb myślący, wersja płatna).

Część 1.

Obrazekhttps://zapodaj.net/plik-PM02JtkjWB

Część 2.

Obrazekhttps://zapodaj.net/plik-fJTGByXZYo

Widać, że mimo kiepskiej transliteracji, rodzaj zapisu i główne osoby zostały potem w tłumaczeniu oddane prawie dobrze.

Z błędów mamy przede wszystkim:
- błędy w odczycie nazw własnych, głównie 1-2 literowe, ale jest też Chyczewska odczytana jako Turska,
- wzięty "z powietrza" wiek sióstr Gajewskich (virginum odczytane jako viginti),
- słowo avunculum zostało błędnie rozpoznane jako Marianna, przez co w tłumaczeniu pominięto informację o pokrewieństwie między Jakubem Gajewskim a Dobrogostem Kłobukowskim,
- w wyniku błędnego odczytania kolejnych kilku słów utraciliśmy też informację, że Dobrogost zmarł bezpotomnie,
- tylko 1 błąd w odczycie imion (Dobrosław zamiast Dobrogosta).

Na plus zaliczam wyłapanie przez Gemini faktu, że Fabian notowany jest tu z dwoma nazwiskami.

Podkreślam, że problem dotyczy przede wszystkim księgi płockiej. Obie pozostałe, już XVIII-wieczne księgi grodzkie (nurska i ciechanowskie) mają w tagach i tłumaczeniach znacznie mniej błędów!

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: wt 10 mar 2026, 21:54
autor: Michał_Zieliński
Bartku, bardzo dziękuję za szczegółową analizę. Chyba w pierwszej kolejności warto skupić się na księgach XVIII wiecznych, gdzie AI dużo lepiej sobie radzi. Z drugiej strony księga płocka była obrabiana w większej części bez bazy nazwisk. Zauważyliśmy że dodanie bazy nazwisk bardzo ogranicza liczbę błędów w tagach danych osobowych, a na tych najbardziej nam zależy, transliteracja i tłumaczenie jest niejako przy okazji.

Bardzo dziękujemy za udział w ankiecie. Teraz poszukujemy kilku osób, które oznaczyłyby księgi, tak aby można było je poddać pod obróbkę AI. Oczywiście pierwszeństwo mają "zwycięskie" zespoły (szczątki zespołów ksiąg miejskich sądowych z woj. małopolskiego, grodzkie sieradzkie, nurskie i ciechanowskie). Zadanie jest banalnie proste, ale samo się nie zrobi :wink: Oczywiście wszystko dokładnie wyłtumaczę. Trzeba mieć tylko dostęp do Internetu i być zarejestrowanym użytkownikiem tego forum.

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: śr 11 mar 2026, 08:44
autor: Kołakowski_Jerzy
Zgłaszam gotowość do indeksowania (tagowania) ksiąg ziemskich/grodzkich ciechanowskich - ewentualnie płockich. Bazę danych tj. Rejestr Poborowy z 1775 roku (w wersji WORD) mogę przesłać na wskazany adres.

Jerzy Kołakowski

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: śr 11 mar 2026, 10:33
autor: Michał_Zieliński
Dziękuję.
Dla jasności: tu nie chodzi o indeksowanie (tagowanie). To może robić każdy zarejestrowany użytkownik samodzielnie już od dawna. Tu chodzi o oznaczenie kwadratami (jak na przykładzie w pierwszym poście) każdego wpisu, tak aby AI mogło rozróżnić co stanowi całość (pojedynczy wpis) i go obrobić. Tak więc praca dużo mniej "merytoryczna".

Re: Skanoteka - indeksowanie zespołów sądowych przez AI

: śr 11 mar 2026, 11:12
autor: Kołakowski_Jerzy
Michał_Zieliński pisze: śr 11 mar 2026, 10:33 Dziękuję.
Dla jasności: tu nie chodzi o indeksowanie (tagowanie). To może robić każdy zarejestrowany użytkownik samodzielnie już od dawna. Tu chodzi o oznaczenie kwadratami (jak na przykładzie w pierwszym poście) każdego wpisu, tak aby AI mogło rozróżnić co stanowi całość (pojedynczy wpis) i go obrobić. Tak więc praca dużo mniej "merytoryczna".
Myślałem, że dobrze by było na bieżąco korygować (porównać) zgodność translacji przez AI miejscowości, nazwisk i imion, tak aby kolejni użytkownicy bazowali na sprawdzonych danych.

Jerzy Kołakowski