Skanoteka - indeksowanie zespołów sądowych przez AI
Moderatorzy: elgra, maria.j.nie
Re: Skanoteka - indeksowanie zespołów sądowych przez AI
jeśli nadal poszukiwana jest osoba do pomocy przy przygotowywaniu materiałów dla AI to chętnie pomogę 
- kwroblewska

- Posty: 3457
- Rejestracja: czw 16 sie 2007, 21:32
- Lokalizacja: Łódź
- Podziękował: 12 times
- Otrzymał podziękowania: 31 times
Re: Skanoteka - indeksowanie zespołów sądowych przez AI
Brałam udział w ankiecie i głosowałam na księgi sieradzkie.
Ankietę ZDECYDOWANIE WYGRAŁY KSIĘGI GRODZKIE SIERADZKIE!!!!!!,
Zapis zespołów w takiej kolejność sugeruje, że najwyższą punktację, co nie jest prawdą, miał zespół ksiąg miejskich z woj. małopolskiego.
Można powiedzieć, że i tak lepsze to niż kolejność alfabetyczna bo wtedy księgi sieradzkie byłby na końcu.
Tytuł ankiety był:
"Jaki ZESPÓŁ w pierwszej kolejności dać do obróbki (10 jednostek z II połowy XVIII w.)?
Warto było dążyć do tego, co zrobiły osoby popierające 25 osób, aby księgi sieradzkie wygrały, gdyż inne księgi zaproponowane w ankiecie, brały już udział w testach.
W ramach testów obrobiono
A właściwie to po co była ta ankieta jesli wszystko z księgami wróciło do punktu wyjścia?
Nieważne że wygrały księgi grodzkie sieradzkie i tak nie będą w pierwszej kolejności cokolwiek to znaczy "obrabiane".
Nagle tytuł ZESPÓŁ szybko przemienił się w ZESPOŁY i zostały one rozbudowany o pozostałe zespoły- sądowe z woj. małopolskiego, nurskie -10, ciechanowskie-7, które już wcześniej brały udział w testach, a teraz osiągnęły głosów odpowiednio 10 i 7.
A dlaczego w tych "próbnych" testach nie brały udziału księgi grodzkie sieradzkie, łęczyckie czy wieluński nawet w ankiecie nie uwzględniono ksiąg grodzkich łęczyckich i wieluńskich?
-----
Krystyna
Ankietę ZDECYDOWANIE WYGRAŁY KSIĘGI GRODZKIE SIERADZKIE!!!!!!,
Michał_Zieliński pisze: wt 10 mar 2026, 21:54 Bardzo dziękujemy za udział w ankiecie.
Oczywiście pierwszeństwo mają "zwycięskie" zespoły (szczątki zespołów ksiąg miejskich sądowych z woj. małopolskiego, grodzkie sieradzkie, nurskie i ciechanowskie).
Zapis zespołów w takiej kolejność sugeruje, że najwyższą punktację, co nie jest prawdą, miał zespół ksiąg miejskich z woj. małopolskiego.
Można powiedzieć, że i tak lepsze to niż kolejność alfabetyczna bo wtedy księgi sieradzkie byłby na końcu.
Tytuł ankiety był:
"Jaki ZESPÓŁ w pierwszej kolejności dać do obróbki (10 jednostek z II połowy XVIII w.)?
Warto było dążyć do tego, co zrobiły osoby popierające 25 osób, aby księgi sieradzkie wygrały, gdyż inne księgi zaproponowane w ankiecie, brały już udział w testach.
W ramach testów obrobiono
Michał_Zieliński pisze: sob 21 lut 2026, 15:02 Jednostki już dostępne
W ramach testów zostało obrobionych całościowo 5 jednostek:
- księga grodzka płocka: https://skanoteka.genealodzy.pl/id1669-sy141-se1
- księga grodzka nurska:https://skanoteka.genealodzy.pl/id4652-sy29-se4
- księga grodzka ciechanowska: https://skanoteka.genealodzy.pl/id1671-sy163-se1
- księga wójtowsko-ławnicza gminy Krowodrza: https://skanoteka.genealodzy.pl/id3428-sy4-se
- księga wójtowsko-ławnicza jurydyki Grabary: https://skanoteka.genealodzy.pl/id3059-sy46-se31
A właściwie to po co była ta ankieta jesli wszystko z księgami wróciło do punktu wyjścia?
Nieważne że wygrały księgi grodzkie sieradzkie i tak nie będą w pierwszej kolejności cokolwiek to znaczy "obrabiane".
Nagle tytuł ZESPÓŁ szybko przemienił się w ZESPOŁY i zostały one rozbudowany o pozostałe zespoły- sądowe z woj. małopolskiego, nurskie -10, ciechanowskie-7, które już wcześniej brały udział w testach, a teraz osiągnęły głosów odpowiednio 10 i 7.
A dlaczego w tych "próbnych" testach nie brały udziału księgi grodzkie sieradzkie, łęczyckie czy wieluński nawet w ankiecie nie uwzględniono ksiąg grodzkich łęczyckich i wieluńskich?
-----
Krystyna
-
sirdaniel

- Posty: 330
- Rejestracja: ndz 25 mar 2012, 19:54
- Podziękował: 3 times
- Otrzymał podziękowania: 2 times
Re: Skanoteka - indeksowanie zespołów sądowych przez AI
Dzisiaj się bawiłem w rozczytywanie zapisów metrykalnych przez Gemini. Zwykłe kopiuj wycinek screena i potem wklej do okna dialogowego. Zauważyłem, że AI dobrze sobie radzi, gdy obraz jest powiększony. Tym samym lepiej czytelny dla AI. Zauważyłem, że ostatni chatGPT ma tez w changelogu dla GPT‑5.4 pisze coś o zachowaniu pełnej rozdzielczości obrazu. Znaczy się to ma znaczenie.
Nie wiem jak działają skrypty dla skanoteki, ale warto wziąść pod uwagę, czy model nie zmniejsza sobie obrazu przez ograniczenia tokenow albo dla polepszenia sprawności działania.
Nie wiem jak działają skrypty dla skanoteki, ale warto wziąść pod uwagę, czy model nie zmniejsza sobie obrazu przez ograniczenia tokenow albo dla polepszenia sprawności działania.
- Michał_Zieliński

- Posty: 1189
- Rejestracja: wt 22 lut 2011, 13:00
- Lokalizacja: Warszawa
- Podziękował: 2 times
- Otrzymał podziękowania: 87 times
Re: Skanoteka - indeksowanie zespołów sądowych przez AI
Można porównywać i poprawiać (wpisać prawidłowy tag, jak się zauważy błąd, błędnego tagu AI nie usuwamy). Może to robić każdy użytkownik. Natomiast nie wprowadzamy wymogu weryfikacji przed publikacją, bo wtedy nigdy nie ruszymy z miejsca.Kołakowski_Jerzy pisze: śr 11 mar 2026, 11:12 Myślałem, że dobrze by było na bieżąco korygować (porównać) zgodność translacji przez AI miejscowości, nazwisk i imion, tak aby kolejni użytkownicy bazowali na sprawdzonych danych.
Jerzy Kołakowski
Zapraszamy do uczestniczenia w zaznaczaniu skanów. Bez tego nie da się poddać ich obróbce AI. Jak na razie zgłosiły się dwie osoby.
Pozdrawiam,
Michał
Michał
-
semux

- Posty: 48
- Rejestracja: czw 20 kwie 2023, 15:56
- Lokalizacja: Nowe Grabie koło Gąbina
- Podziękował: 6 times
- Otrzymał podziękowania: 16 times
Re: Skanoteka - indeksowanie zespołów sądowych przez AI
Myślę, że można spróbować wykorzystać AI do "zaznaczania" bloków tekstu.Michał_Zieliński pisze: pn 16 mar 2026, 21:00 Zapraszamy do uczestniczenia w zaznaczaniu skanów. Bez tego nie da się poddać ich obróbce AI. Jak na razie zgłosiły się dwie osoby.
Poniżej przykład (bardzo prosty) jak można uzyskać informacje o blokach z aktami.
Prompt:
Znajdź na skanie poszczególne akty, znajdź obwiednię i podaj w postaci listy z danymi bbox_2d i text_content (text_content - to numer aktu) wg przykładu:
[{"bbox_2d": [83, 915, 112, 944], "text_content": "127"}]
Model:
Użyłem gemini, ale i qwen 3.5 to potrafi.
Wynik:
Kod: Zaznacz cały
[
{"bbox_2d": [75, 513, 351, 959], "text_content": "121"},
{"bbox_2d": [361, 513, 638, 974], "text_content": "122"},
{"bbox_2d": [638, 513, 942, 972], "text_content": "123"},
{"bbox_2d": [78, 26, 350, 489], "text_content": "118"},
{"bbox_2d": [355, 26, 626, 489], "text_content": "119"},
{"bbox_2d": [643, 26, 949, 492], "text_content": "120"}
]
https://zapodaj.net/plik-d6fC4XcHBZUwaga zwracane dane bbox - to nie dane w pixelach, ale:
Dane bbox to cztery liczby określające położenie prostokąta na obrazie.
Podawane są w kolejności: góra (ymin), lewo (xmin), dół (ymax), prawo (xmax).
Punkt zero znajduje się zawsze w lewym górnym rogu zdjęcia. Pierwsza para liczb wyznacza początek ramki, a druga para jej koniec.
Większość modeli nie podaje pikseli, lecz wartości od 0 do 1000. Oznacza to, że liczba 500 zawsze odpowiada połowie zdjęcia, niezależnie od jego rzeczywistego rozmiaru.
Aby narysować taką ramkę na swoim zdjęciu, musisz przeliczyć te udziały procentowe na piksele.
Przykładowo, jeśli model poda wartość 250 dla szerokości, oznacza to, że ramka zaczyna się w 1/4 szerokości oryginalnego pliku.
pozdrawiam
Sergiusz
