loading . . . Jak zainstalować program OCR na Ubuntu Masz stos zeskanowanych dokumentów, które musisz przeszukać, a pliki PDF zachowują się jak obrazki. Nic w nich nie da się zaznaczać, kopiować ani przeszukiwać. Właśnie do rozwiązania takich problemów służy **OCR** (Optical Character Recognition) – technologia, która zamienia obraz tekstu w prawdziwy, edytowalny tekst. I dobra wiadomość… na Ubuntu masz do wyboru kilka solidnych narzędzi, zarówno graficznych, jak i wiersza poleceń.
Warto wiedzieć, że rynek OCR rośnie w imponującym tempie – według Allied Market Research globalny rynek systemów OCR miał wartość 12,2 miliarda dolarów w 2024 roku i do 2034 roku osiągnie 50,6 miliarda dolarów, rosnąc przy rocznym tempie wzrostu (CAGR) 15,1%. To nie jest niszowa technologia, z OCR korzystają banki, szpitale, urzędy i zwykli użytkownicy, którzy po prostu chcą przeszukać swoje dokumenty.
## Czym właściwie jest OCR i do czego go używać
**OCR** (Optical Character Recognition, czyli optyczne rozpoznawanie znaków) to proces, w którym oprogramowanie analizuje obraz – zdjęcie, skan lub plik PDF i wyodrębnia z niego tekst w formie edytowalnej. Dzięki temu możesz wziąć zdjęcie faktury, wpuścić je do programu OCR i otrzymać plik tekstowy, który możesz edytować, kopiować czy przeszukiwać.
Na Ubuntu masz dostęp do kilku sprawdzonych rozwiązań: silnika **Tesseract-OCR** (który obsługuje ponad 100 języków, w tym polski), nakładki graficznej **gImageReader** , skanera z OCR **gscan2pdf** oraz narzędzia wiersza poleceń **OCRmyPDF** , dedykowanego plikom PDF. Każde z nich ma swoje mocne strony, dlatego warto znać wszystkie.
## Tesseract – serce każdego rozwiązania OCR na Linuksie
**Tesseract-OCR** to open-source’owy silnik OCR rozwijany początkowo przez HP, a następnie przejęty przez Google. Większość graficznych aplikacji OCR na Linuksie używa go pod spodem – jest fundamentem całego ekosystemu. Bez niego ani **gImageReader** , ani **gscan2pdf** nie będą działać.
## Instalacja Tesseract na Ubuntu
Instalacja standardowej wersji z repozytoriów Ubuntu jest banalnie prosta. Otwórz terminal i wpisz:
sudo apt update
sudo apt install tesseract-ocr
Jeśli potrzebujesz polskiego słownika rozpoznawania znaków, doinstaluj pakiet językowy:
sudo apt install tesseract-ocr-pol
A dla angielskiego (często potrzebny przy dokumentach mieszanych):
sudo apt install tesseract-ocr-eng
Chcesz sprawdzić, jakie języki masz już zainstalowane? Użyj polecenia:
tesseract --list-langs
Jeśli zależy Ci na najnowszej wersji Tesseract 5 (która oferuje lepszą dokładność dzięki modelom LSTM), możesz dodać nieoficjalne PPA:
sudo add-apt-repository ppa:alex-p/tesseract-ocr5
sudo apt update && sudo apt install tesseract-ocr
## Pierwsze użycie z linii poleceń
Tesseract możesz uruchomić bezpośrednio z terminala. Jeśli masz plik JPG lub TIFF ze zeskanowanym dokumentem, użyj polecenia:
tesseract plik.jpg wynik -l pol
Program stworzy plik wynik.txt z rozpoznanym tekstem. Prosto i sprawnie. Możesz też wyeksportować wynik do formatu PDF:
tesseract plik.jpg wynik -l pol pdf
## gImageReader – graficzny interfejs dla Tesseract
Jeśli wiersz poleceń nie jest Twoim ulubionym miejscem pracy, **gImageReader** to graficzna nakładka na Tesseract, którą obsługujesz myszką. Obsługuje pliki JPG, PNG, TIFF, BMP, PDF i wiele innych formatów. Możesz zaznaczać obszary na obrazie i rozpoznawać tylko wybrane fragmenty – przydatne przy dokumentach z wielokolumnowym układem (layout).
## Instalacja gImageReader
Instalacja jest równie szybka co Tesseract. W terminalu wpisz:
sudo apt install gimagereader
Po uruchomieniu programu interfejs graficzny (GUI) pozwala Ci wczytać plik, wybrać język rozpoznawania i kliknąć przycisk „Rozpoznaj”. Wynik pojawia się w panelu tekstowym po prawej stronie, skąd możesz go skopiować do schowka lub zapisać do pliku.
Pamiętaj – **gImageReader** wymaga zainstalowanego Tesseract. Jeśli pominąłeś poprzedni krok, program się uruchomi, ale OCR nie zadziała.
## gscan2pdf – skaner i OCR w jednym miejscu
**gscan2pdf** to program, który łączy skanowanie dokumentów z silnikiem OCR. Jeśli masz fizyczny skaner podłączony do komputera, to właśnie gscan2pdf pozwoli Ci zeskanować dokument i od razu rozpoznać tekst – wszystko w jednym oknie. Obsługuje formaty PDF, DJVU, TIFF i wiele innych.
## Instalacja gscan2pdf
sudo apt install gscan2pdf
Po instalacji program automatycznie wykrywa dostępne skanery obsługiwane przez SANE/XSane. Możesz skanować wielostronicowe dokumenty, a następnie uruchomić OCR na całym pliku lub wybranych stronach. Wynik możesz zapisać jako przeszukiwalny plik PDF, co jest szczególnie przydatne przy archiwizowaniu dokumentów.
## OCRmyPDF – narzędzie do plików PDF z wiersza poleceń
**OCRmyPDF** to trochę inna kategoria narzędzi – jego zadaniem jest dodanie warstwy tekstowej do już istniejącego pliku PDF. Masz zeskanowany dokument zapisany jako PDF, ale nie możesz nic w nim zaznaczać? OCRmyPDF naprawia ten problem.
## Instalacja OCRmyPDF
Najprostszy sposób instalacji przez Snap:
sudo snap install ocrmypdf
Alternatywnie przez menedżer pakietów pip:
pip install ocrmypdf
## Użycie
Podstawowe polecenie wygląda tak:
ocrmypdf -l pol wejście.pdf wyjście.pdf
Program przetworzy plik wejście.pdf, doda do niego warstwę OCR w języku polskim i zapisze wynik jako wyjście.pdf. Powstanie przeszukiwalny, normalny plik PDF.
## OcrFeeder – dla tych, którzy chcą więcej kontroli
**OcrFeeder** to kolejna aplikacja graficzna na Ubuntu, która potrafi automatycznie analizować układ strony i dopasowywać obszary tekstu do bloków. Obsługuje różne silniki OCR, w tym Tesseract, gOCR i Cuneiform. Interfejs jest bardziej rozbudowany niż w gImageReader, co bywa zarówno zaletą, jak i wyzwaniem dla nowych użytkowników.
## Instalacja OcrFeeder
sudo apt install ocrfeeder
Program ma wbudowany moduł importu plików z skanera (przez Simple Scan lub XSane) i pozwala eksportować wyniki do formatów ODT, HTML czy TXT. Dla kogoś, kto regularnie przetwarza duże partie dokumentów, jest naprawdę użyteczny.
UWAGA! Jeśli paczka z repo Ubuntu nie ruszy, zainstaluj program przez repozytorium Flatpaka.
## Który program wybrać – praktyczna wskazówka
Wybór zależy od Twoich potrzeb. Jeśli dopiero zaczynasz przygodę z OCR na Ubuntu, polecam zainstalować **Tesseract** (jako silnik) i do niego **gImageReader** jako graficzny interfejs – to połączenie sprawdza się w 90% przypadków. Do pracy z istniejącymi plikami PDF doskonale nadaje się **OCRmyPDF**. Jeśli masz skaner i chcesz wszystko obsługiwać w jednym miejscu, wybierz **gscan2pdf**.
Warto wiedzieć, że dokładność rozpoznawania tekstu zależy mocno od jakości skanu. Dokumenty skanowane w rozdzielczości 300 DPI lub wyższej dają znacznie lepsze wyniki niż zdjęcia z telefonu zrobione przy kiepskim oświetleniu. Tesseract poradzi sobie z większością standardowych dokumentów, ale krzywy skan z niskim kontrastem potrafi go zmylić nawet przy najlepszych ustawieniach.
Digitalizacja dokumentów to dziś wymóg, a nie kaprys biurokratyczny i Ubuntu daje Ci do tego pełen zestaw narzędzi, **za darmo** , nie trzeba żadnych licencji. Wystarczy kilka poleceń w terminalu i masz działający **program OCR** , który spokojnie konkuruje z komercyjnymi rozwiązaniami typu ABBYY FineReader.
## FAQ – najczęściej zadawane pytania o OCR na Ubuntu
Poniżej zebrałem pytania, które regularnie pojawiają się na forach i w komentarzach pod podobnymi poradnikami. Jeśli masz swój problem, pewnie znajdziesz tu odpowiedź.
**Czy OCR na Ubuntu obsługuje język polski?**
Tak, Tesseract obsługuje język polski po zainstalowaniu pakietu tesseract-ocr-pol. Jakość rozpoznawania polskich znaków diakrytycznych jest dobra, szczególnie przy wyraźnych skanach w wysokiej rozdzielczości.
**Czy potrzebuję fizycznego skanera, żeby używać OCR?**
Nie musisz mieć skanera – OCR działa również na zdjęciach z telefonu, istniejących plikach PDF, plikach JPG, PNG, TIFF i wielu innych formatach obrazów.
**Czym różni się Tesseract od gImageReader?**
Tesseract to silnik rozpoznawania znaków działający w wierszu poleceń. **gImageReader** to graficzny interfejs (GUI), który używa Tesseract pod spodem i pozwala obsługiwać OCR bez znajomości komend.
**Czy OCRmyPDF nadpisuje oryginalny plik PDF?**
Nie – musisz podać oddzielną nazwę pliku wyjściowego. Oryginał pozostaje nienaruszony, a nowy plik zawiera dodaną warstwę tekstową.
**Jak poprawić jakość rozpoznawania tekstu?**
Dobrze jest skanować dokumenty w rozdzielczości 300-600 DPI, zadbać o dobre oświetlenie i kontrast oraz wyprostować krzywe skany przed przetwarzaniem – do tego możesz użyć narzędzia Scan Tailor.
**Czy Tesseract obsługuje pliki PDF?**
Tesseract sam w sobie pracuje na obrazach. Do bezpośredniego przetwarzania plików PDF lepsza opcja to **OCRmyPDF** , które łączy konwersję PDF z silnikiem Tesseract.
**Czy OCR na Ubuntu jest bezpłatny?**
Wszystkie opisane narzędzia – Tesseract, gImageReader, gscan2pdf, OcrFeeder i OCRmyPDF – są bezpłatne i open-source. Żadnych licencji, żadnych subskrypcji.
**Czy mogę przetworzyć wsadowo wiele plików naraz?**
Tesseract i OCRmyPDF obsługują przetwarzanie wsadowe z poziomu terminala. Możesz napisać prosty skrypt powłoki, który przetworzy cały folder z plikami JPG lub PDF za jednym razem.
**Czy gImageReader zapisuje wyniki do PDF?**
Tak, **gImageReader** pozwala eksportować rozpoznany tekst do pliku TXT lub PDF z warstwą tekstową.
**Czy OCR radzi sobie z odręcznym pismem?**
Tesseract nie jest przystosowany do rozpoznawania pisma odręcznego – radzi sobie wyłącznie z drukowanym tekstem maszynowym. Do odręcznego pisma potrzebujesz specjalistycznych modeli, które są poza standardowym zakresem narzędzi opisanych w tym artykule.
**Jak sprawdzić, które języki mam zainstalowane w Tesseract?**
W terminalu wpisz polecenie tesseract –list-langs, a program wyświetli pełną listę dostępnych pakietów językowych.
**Czy mogę używać OCR na Ubuntu w starszych wersjach, jak 16.04?**
Tesseract i gImageReader działają na Ubuntu od wersji 16.04 wzwyż, ale dobrze jest korzystać z aktualnych wydań LTS (22.04, 24.04), które mają nowsze wersje pakietów i lepsze wsparcie.
🚀 Chcesz opanować więcej ukrytych funkcji i rozwiązać inne cyfrowe problemy? Na blogu TechFormator.pl czekają na Ciebie dziesiątki poradników, które podniosą Twoje umiejętności IT. Wskakuj po kolejną dawkę wiedzy! https://techformator.pl/jak-zainstalowac-program-ocr-na-ubuntu/