Nuovo OCR per Linux

Postate qui per tutte le discussioni legate a Linux in generale.

Moderatore: Staff

Regole del forum
1) Citare sempre la versione di Slackware usata, la versione del Kernel e magari anche la versione della libreria coinvolta. Questi dati aiutano le persone che possono rispondere.
2) Per evitare confusione prego inserire in questo forum solo topic che riguardano appunto Gnu/Linux in genere, se l'argomento è specifico alla Slackware usate uno dei forum Slackware o Slackware64.
3) Leggere attentamente le risposte ricevute
4) Scrivere i messaggi con il colore di default, evitare altri colori.
5) Scrivere in Italiano o in Inglese, se possibile grammaticalmente corretto, evitate stili di scrittura poco chiari, quindi nessuna abbreviazione tipo telegramma o scrittura stile SMS o CHAT.
6) Appena registrati è consigliato presentarsi nel forum dedicato.

La non osservanza delle regole porta a provvedimenti di vari tipo da parte dello staff, in particolare la non osservanza della regola 5 porta alla cancellazione del post e alla segnalazione dell'utente. In caso di recidività l'utente rischia il ban temporaneo.
Rispondi
samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Nuovo OCR per Linux

Messaggio da samiel »

Non so se sono l'unico a entusiasmarsi per questa notizia,
ma per i miei lavori uso spesso l'OCR, e OmniPage
è l'unico motivo per cui ho ancora Windows nel pc
(Wine non riesce a farlo girare). Adesso Gogle
annuncia questo: http://punto-informatico.it/p.aspx?id=1632194&r=PI
che sembra far sperare bene...

M.

albatrosla
Packager
Packager
Messaggi: 1339
Iscritto il: sab 27 mar 2004, 0:00
Slackware: current
Desktop: fluxbox.git
Località: Collegno, but made in Friûl
Contatta:

Messaggio da albatrosla »

Notizia stupenda! Spero che migliori in fretta: da quanto si capisce dall'articolo, non fa lavori granchè migliori degli attuali gocr & co. Ma Google è ricca e investe a palate quindi presto qualcosa di buono arriverà di certo! E' una gran notizia... che fa capire come mai la Micro$oft tema sempre di più Google!

Avatar utente
aschenaz
Staff
Staff
Messaggi: 4623
Iscritto il: mer 28 lug 2004, 0:00
Nome Cognome: Nino
Slackware: current
Kernel: 5.4.x
Desktop: KDE
Località: Reggio Calabria
Contatta:

Messaggio da aschenaz »

Speriamo sia meglio di certi OCR free che girano sotto win.
Con alcuni fai prima a ricopiare a manina... :?

Avatar utente
albatros
Iper Master
Iper Master
Messaggi: 2098
Iscritto il: sab 4 feb 2006, 13:59
Kernel: 6.18.0
Desktop: gnome and lxqt
Distribuzione: Ubuntu 24.04 & FC 41
Località: Darmstadt - Germania

Messaggio da albatros »

Ho letto l'articolo, l'ho provato e sono rimasto piuttosto deluso... :( :( :( :cry:

samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Messaggio da samiel »

Io non sono riuscito a usarlo...
mi dà errore- Che passaggi hai seguito?

comunque loo stessi ammettono
che deve fare molta strada,
ma pare che Google finanzierà
lo sviluppo del progetto...

M.

Avatar utente
albatros
Iper Master
Iper Master
Messaggi: 2098
Iscritto il: sab 4 feb 2006, 13:59
Kernel: 6.18.0
Desktop: gnome and lxqt
Distribuzione: Ubuntu 24.04 & FC 41
Località: Darmstadt - Germania

Messaggio da albatros »

Nel post precedente mi sono sbagliato con un altro ocr, questo è già un po' meglio, almeno con i testi in inglese. Scusa(te)...

Per compilare ho dato il classico ./configure (con le ottimizzazioni, ma è un fatto secondario - compilatore gcc-4.1.1 - glibc 2.3.6 - libtiff 3.7.1).
make
NON ho dato il make install perché al termine o del configure o del make veniva detto di non farlo perché non ancora implementato.
tesseract (eseguibile) è in ccmain, se leggi le istruzioni e l'errore che ti dà a lanciarlo da lì, capisci che devi spostarlo nella directory che contiene tessdata, ovvero nella directory sopra quella dove è, ovvero la tesseract-1.01 dove ci sono anche il README e l'INSTALL.
Ho fatto a questo punto la scansione di una pagina di un testo inglese a 300dpi.
L'input deve essere un file tiff (b/n, credo), non compresso se non hai compilato con le libtiff (che di solito ci sono), senza figure e a una sola colonna.
Poi dai banalmente, se metti l'immagine dov'è l'eseguibile: ./tesseract file-input.tiff file-output. Ti verrà un file-output.txt con, se la scansione è come vuole l'ocr, un discreto riconoscimento dei caratteri.
Non è un ocr pratico da usare e con l'italiano temo peggiori, però è già un buon punto di partenza...

samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Messaggio da samiel »

Ok, grazie. Il mio errore è stato che l'ho messo
come motore di Kooka, che evidentemente non lo supporta.
Ma perché Kooka non salva in tiff?

Grazie!
M.

samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Messaggio da samiel »

Codice: Seleziona tutto

bash-3.1$ ./tesseract Immagine.tif prova.txt
Tesseract Open Source OCR Engine
È fermo da almeno 5 minuti per una pagina...
Tutto normale???

M.

Avatar utente
Loris
Admin
Admin
Messaggi: 7731
Iscritto il: lun 31 mar 2003, 0:00
Nome Cognome: Loris Vincenzi
Località: Gradisca D'Isonzo
Contatta:

Messaggio da Loris »

Il make install installa solo tesseract in /usr/bin (ho provato) ma poi quando lo usi lamenta la mancanza dei file presenti in tessdata, quindi il make install funziona a metà :(
"Ho una testa piuttosto balzana e comunque non sono quello che credete" - Roger Keith Barrett

Avatar utente
absinthe
Iper Master
Iper Master
Messaggi: 2354
Iscritto il: dom 15 mag 2005, 0:00
Nome Cognome: Matteo Nunziati
Slackware: 12.1 - defunct
Kernel: 2.6.32-5-amd64
Desktop: gnome
Distribuzione: debian squeeze
Località: Prato
Contatta:

Messaggio da absinthe »

beh ragazzi molti dei software free non hanno addestramento: paghi il gratuito con il tempo di addestramento della rete neurale che gestisce il riconoscimento... che ci vuoi fare...

M

Avatar utente
gohanz
Staff
Staff
Messaggi: 5832
Iscritto il: mar 30 nov 2004, 0:00

Messaggio da gohanz »

Using the Engine
================
The usage of both Windows and Linux versions is the same.
The executable must reside in the same directory as the tessdata directory
The command line is:
tesseract <image.tif> <output> batch
The image file requires an .tif extension for its type to be recognized
correctly. If a file exists with the .tif extension replaced by .uzn, then it
will be interpreted as a UNLV-style zone file. (See http://www.isri.unlv.edu for
details of the zone files.)
Basterebbe copiare l'eseguibile in /usr/share/tesseract e copiare nella stessa, la directory /tessdata.
Poi creare uno script wrapper in /usr/bin che richiami il binario vero in /usr/share/tesseract

samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Messaggio da samiel »

Gohanz, perché non lo pacchettizi
per slacky? Possiamo provarlo e inviare
eventuali rilievi o richieste di funzioni
da implementare all'attuale sviluppatore...

M.

Avatar utente
gohanz
Staff
Staff
Messaggi: 5832
Iscritto il: mar 30 nov 2004, 0:00

Messaggio da gohanz »

Si va bene posso provare! Mi sono fermato, nella produzione di pacchetti, in attesa della 11!Immagine

samiel
Staff
Staff
Messaggi: 5511
Iscritto il: ven 16 gen 2004, 0:00
Nome Cognome: Mauro Sacchetto
Slackware: 13.0
Kernel: 2.26
Desktop: KDE
Distribuzione: anche Debian
Località: Venezia

Messaggio da samiel »

Fatto sta che ho provato a scansionare,
ma dopo venti minuti era ancora fermo
e non capisco che cosa non vada...

M.

Rispondi