Pagina 1 di 1

Nuovo OCR per Linux

Inviato: ven 15 set 2006, 14:51
da samiel
Non so se sono l'unico a entusiasmarsi per questa notizia,
ma per i miei lavori uso spesso l'OCR, e OmniPage
è l'unico motivo per cui ho ancora Windows nel pc
(Wine non riesce a farlo girare). Adesso Gogle
annuncia questo: http://punto-informatico.it/p.aspx?id=1632194&r=PI
che sembra far sperare bene...

M.

Inviato: ven 15 set 2006, 16:36
da albatrosla
Notizia stupenda! Spero che migliori in fretta: da quanto si capisce dall'articolo, non fa lavori granchè migliori degli attuali gocr & co. Ma Google è ricca e investe a palate quindi presto qualcosa di buono arriverà di certo! E' una gran notizia... che fa capire come mai la Micro$oft tema sempre di più Google!

Inviato: ven 15 set 2006, 19:21
da aschenaz
Speriamo sia meglio di certi OCR free che girano sotto win.
Con alcuni fai prima a ricopiare a manina... :?

Inviato: ven 15 set 2006, 23:00
da albatros
Ho letto l'articolo, l'ho provato e sono rimasto piuttosto deluso... :( :( :( :cry:

Inviato: sab 16 set 2006, 0:27
da samiel
Io non sono riuscito a usarlo...
mi dà errore- Che passaggi hai seguito?

comunque loo stessi ammettono
che deve fare molta strada,
ma pare che Google finanzierà
lo sviluppo del progetto...

M.

Inviato: sab 16 set 2006, 2:42
da albatros
Nel post precedente mi sono sbagliato con un altro ocr, questo è già un po' meglio, almeno con i testi in inglese. Scusa(te)...

Per compilare ho dato il classico ./configure (con le ottimizzazioni, ma è un fatto secondario - compilatore gcc-4.1.1 - glibc 2.3.6 - libtiff 3.7.1).
make
NON ho dato il make install perché al termine o del configure o del make veniva detto di non farlo perché non ancora implementato.
tesseract (eseguibile) è in ccmain, se leggi le istruzioni e l'errore che ti dà a lanciarlo da lì, capisci che devi spostarlo nella directory che contiene tessdata, ovvero nella directory sopra quella dove è, ovvero la tesseract-1.01 dove ci sono anche il README e l'INSTALL.
Ho fatto a questo punto la scansione di una pagina di un testo inglese a 300dpi.
L'input deve essere un file tiff (b/n, credo), non compresso se non hai compilato con le libtiff (che di solito ci sono), senza figure e a una sola colonna.
Poi dai banalmente, se metti l'immagine dov'è l'eseguibile: ./tesseract file-input.tiff file-output. Ti verrà un file-output.txt con, se la scansione è come vuole l'ocr, un discreto riconoscimento dei caratteri.
Non è un ocr pratico da usare e con l'italiano temo peggiori, però è già un buon punto di partenza...

Inviato: sab 16 set 2006, 3:34
da samiel
Ok, grazie. Il mio errore è stato che l'ho messo
come motore di Kooka, che evidentemente non lo supporta.
Ma perché Kooka non salva in tiff?

Grazie!
M.

Inviato: sab 16 set 2006, 3:45
da samiel

Codice: Seleziona tutto

bash-3.1$ ./tesseract Immagine.tif prova.txt
Tesseract Open Source OCR Engine
È fermo da almeno 5 minuti per una pagina...
Tutto normale???

M.

Inviato: sab 16 set 2006, 8:39
da Loris
Il make install installa solo tesseract in /usr/bin (ho provato) ma poi quando lo usi lamenta la mancanza dei file presenti in tessdata, quindi il make install funziona a metà :(

Inviato: dom 17 set 2006, 18:23
da absinthe
beh ragazzi molti dei software free non hanno addestramento: paghi il gratuito con il tempo di addestramento della rete neurale che gestisce il riconoscimento... che ci vuoi fare...

M

Inviato: dom 17 set 2006, 19:54
da gohanz
Using the Engine
================
The usage of both Windows and Linux versions is the same.
The executable must reside in the same directory as the tessdata directory
The command line is:
tesseract <image.tif> <output> batch
The image file requires an .tif extension for its type to be recognized
correctly. If a file exists with the .tif extension replaced by .uzn, then it
will be interpreted as a UNLV-style zone file. (See http://www.isri.unlv.edu for
details of the zone files.)
Basterebbe copiare l'eseguibile in /usr/share/tesseract e copiare nella stessa, la directory /tessdata.
Poi creare uno script wrapper in /usr/bin che richiami il binario vero in /usr/share/tesseract

Inviato: dom 17 set 2006, 23:46
da samiel
Gohanz, perché non lo pacchettizi
per slacky? Possiamo provarlo e inviare
eventuali rilievi o richieste di funzioni
da implementare all'attuale sviluppatore...

M.

Inviato: lun 18 set 2006, 8:34
da gohanz
Si va bene posso provare! Mi sono fermato, nella produzione di pacchetti, in attesa della 11!Immagine

Inviato: lun 18 set 2006, 8:44
da samiel
Fatto sta che ho provato a scansionare,
ma dopo venti minuti era ancora fermo
e non capisco che cosa non vada...

M.