Nuovo OCR per Linux
Moderatore: Staff
Regole del forum
1) Citare sempre la versione di Slackware usata, la versione del Kernel e magari anche la versione della libreria coinvolta. Questi dati aiutano le persone che possono rispondere.
2) Per evitare confusione prego inserire in questo forum solo topic che riguardano appunto Gnu/Linux in genere, se l'argomento è specifico alla Slackware usate uno dei forum Slackware o Slackware64.
3) Leggere attentamente le risposte ricevute
4) Scrivere i messaggi con il colore di default, evitare altri colori.
5) Scrivere in Italiano o in Inglese, se possibile grammaticalmente corretto, evitate stili di scrittura poco chiari, quindi nessuna abbreviazione tipo telegramma o scrittura stile SMS o CHAT.
6) Appena registrati è consigliato presentarsi nel forum dedicato.
La non osservanza delle regole porta a provvedimenti di vari tipo da parte dello staff, in particolare la non osservanza della regola 5 porta alla cancellazione del post e alla segnalazione dell'utente. In caso di recidività l'utente rischia il ban temporaneo.
1) Citare sempre la versione di Slackware usata, la versione del Kernel e magari anche la versione della libreria coinvolta. Questi dati aiutano le persone che possono rispondere.
2) Per evitare confusione prego inserire in questo forum solo topic che riguardano appunto Gnu/Linux in genere, se l'argomento è specifico alla Slackware usate uno dei forum Slackware o Slackware64.
3) Leggere attentamente le risposte ricevute
4) Scrivere i messaggi con il colore di default, evitare altri colori.
5) Scrivere in Italiano o in Inglese, se possibile grammaticalmente corretto, evitate stili di scrittura poco chiari, quindi nessuna abbreviazione tipo telegramma o scrittura stile SMS o CHAT.
6) Appena registrati è consigliato presentarsi nel forum dedicato.
La non osservanza delle regole porta a provvedimenti di vari tipo da parte dello staff, in particolare la non osservanza della regola 5 porta alla cancellazione del post e alla segnalazione dell'utente. In caso di recidività l'utente rischia il ban temporaneo.
-
samiel
- Staff

- Messaggi: 5511
- Iscritto il: ven 16 gen 2004, 0:00
- Nome Cognome: Mauro Sacchetto
- Slackware: 13.0
- Kernel: 2.26
- Desktop: KDE
- Distribuzione: anche Debian
- Località: Venezia
Nuovo OCR per Linux
Non so se sono l'unico a entusiasmarsi per questa notizia,
ma per i miei lavori uso spesso l'OCR, e OmniPage
è l'unico motivo per cui ho ancora Windows nel pc
(Wine non riesce a farlo girare). Adesso Gogle
annuncia questo: http://punto-informatico.it/p.aspx?id=1632194&r=PI
che sembra far sperare bene...
M.
ma per i miei lavori uso spesso l'OCR, e OmniPage
è l'unico motivo per cui ho ancora Windows nel pc
(Wine non riesce a farlo girare). Adesso Gogle
annuncia questo: http://punto-informatico.it/p.aspx?id=1632194&r=PI
che sembra far sperare bene...
M.
-
albatrosla
- Packager

- Messaggi: 1339
- Iscritto il: sab 27 mar 2004, 0:00
- Slackware: current
- Desktop: fluxbox.git
- Località: Collegno, but made in Friûl
- Contatta:
Notizia stupenda! Spero che migliori in fretta: da quanto si capisce dall'articolo, non fa lavori granchè migliori degli attuali gocr & co. Ma Google è ricca e investe a palate quindi presto qualcosa di buono arriverà di certo! E' una gran notizia... che fa capire come mai la Micro$oft tema sempre di più Google!
- albatros
- Iper Master

- Messaggi: 2098
- Iscritto il: sab 4 feb 2006, 13:59
- Kernel: 6.18.0
- Desktop: gnome and lxqt
- Distribuzione: Ubuntu 24.04 & FC 41
- Località: Darmstadt - Germania
Nel post precedente mi sono sbagliato con un altro ocr, questo è già un po' meglio, almeno con i testi in inglese. Scusa(te)...
Per compilare ho dato il classico ./configure (con le ottimizzazioni, ma è un fatto secondario - compilatore gcc-4.1.1 - glibc 2.3.6 - libtiff 3.7.1).
make
NON ho dato il make install perché al termine o del configure o del make veniva detto di non farlo perché non ancora implementato.
tesseract (eseguibile) è in ccmain, se leggi le istruzioni e l'errore che ti dà a lanciarlo da lì, capisci che devi spostarlo nella directory che contiene tessdata, ovvero nella directory sopra quella dove è, ovvero la tesseract-1.01 dove ci sono anche il README e l'INSTALL.
Ho fatto a questo punto la scansione di una pagina di un testo inglese a 300dpi.
L'input deve essere un file tiff (b/n, credo), non compresso se non hai compilato con le libtiff (che di solito ci sono), senza figure e a una sola colonna.
Poi dai banalmente, se metti l'immagine dov'è l'eseguibile: ./tesseract file-input.tiff file-output. Ti verrà un file-output.txt con, se la scansione è come vuole l'ocr, un discreto riconoscimento dei caratteri.
Non è un ocr pratico da usare e con l'italiano temo peggiori, però è già un buon punto di partenza...
Per compilare ho dato il classico ./configure (con le ottimizzazioni, ma è un fatto secondario - compilatore gcc-4.1.1 - glibc 2.3.6 - libtiff 3.7.1).
make
NON ho dato il make install perché al termine o del configure o del make veniva detto di non farlo perché non ancora implementato.
tesseract (eseguibile) è in ccmain, se leggi le istruzioni e l'errore che ti dà a lanciarlo da lì, capisci che devi spostarlo nella directory che contiene tessdata, ovvero nella directory sopra quella dove è, ovvero la tesseract-1.01 dove ci sono anche il README e l'INSTALL.
Ho fatto a questo punto la scansione di una pagina di un testo inglese a 300dpi.
L'input deve essere un file tiff (b/n, credo), non compresso se non hai compilato con le libtiff (che di solito ci sono), senza figure e a una sola colonna.
Poi dai banalmente, se metti l'immagine dov'è l'eseguibile: ./tesseract file-input.tiff file-output. Ti verrà un file-output.txt con, se la scansione è come vuole l'ocr, un discreto riconoscimento dei caratteri.
Non è un ocr pratico da usare e con l'italiano temo peggiori, però è già un buon punto di partenza...
-
samiel
- Staff

- Messaggi: 5511
- Iscritto il: ven 16 gen 2004, 0:00
- Nome Cognome: Mauro Sacchetto
- Slackware: 13.0
- Kernel: 2.26
- Desktop: KDE
- Distribuzione: anche Debian
- Località: Venezia
Codice: Seleziona tutto
bash-3.1$ ./tesseract Immagine.tif prova.txt
Tesseract Open Source OCR Engine
Tutto normale???
M.
Basterebbe copiare l'eseguibile in /usr/share/tesseract e copiare nella stessa, la directory /tessdata.Using the Engine
================
The usage of both Windows and Linux versions is the same.
The executable must reside in the same directory as the tessdata directory
The command line is:
tesseract <image.tif> <output> batch
The image file requires an .tif extension for its type to be recognized
correctly. If a file exists with the .tif extension replaced by .uzn, then it
will be interpreted as a UNLV-style zone file. (See http://www.isri.unlv.edu for
details of the zone files.)
Poi creare uno script wrapper in /usr/bin che richiami il binario vero in /usr/share/tesseract
