Pagina 1 di 1

stranezze di wget -m

Inviato: mer 12 ott 2005, 12:22
da strummer
ciao a tutti,
Leggendo il man di wget e gli altri post presenti qui, ho appunto riscontrato che è l'opzione -m quella utile a scaricare tutto un sito....
ho notato però, che il comando wget -m o wget -r usato per scaricare interi siti, non funziona con tutti alla perfezione, ma con alcuni ne scarica solo una parte?
come mai?
Grazie

Inviato: mer 12 ott 2005, 12:37
da prometeo79
Mi hai preceduto col post. Stessa identica cosa, anzi a me -r non scarica praticamente nulla.

Inviato: mer 12 ott 2005, 13:24
da MAT
Da `man wget`:

Codice: Seleziona tutto

       -l depth
       --level=depth
           Specify recursion maximum depth level depth.  The
           default maximum depth is 5.

Inviato: mer 12 ott 2005, 13:49
da strummer
provato anche quello, ma niente da fare!

Inviato: mer 12 ott 2005, 19:35
da Bart
Dal libro Slackware Linux Essentials, per scaricare un intero sito:

Codice: Seleziona tutto

wget --recursive <url>
wget creerà una directory col nome del sito contenente il sito stesso.

Inviato: gio 13 ott 2005, 1:37
da strummer
wget --recursive è come -r, purtroppo anche con quello non mi fa, o meglio sia -r che -m fanno nella maggior parte dei casi, ma con alcuni no.
Grazie x ora comunque...

Inviato: gio 13 ott 2005, 2:11
da MAT
Bè, io con

Codice: Seleziona tutto

wget -r -l 0 http://mywebsite.org
ho scaricato un sito intero... e a te non va?

Inviato: gio 13 ott 2005, 10:13
da strummer
mah guarda..., come ripeto, tutte queste opzioni funzionano, ma su alcuni siti no, mi stavo chiedendo se a volte nn fosse colpa del codice html, php o javascript di taluni siti... :?: magati ho detto una bischerata, ma a questo punto nn lo so...
ciao

Inviato: gio 13 ott 2005, 11:55
da MAT
Aspetta... wget rispetta il robots.txt!! Non è che la colpa è di quello??

Inviato: gio 13 ott 2005, 12:02
da strummer
Già!! se non sbaglio, il robot.txt, dice cosa fare ai "ragnetti" dei motori di ricerca, tipo seguire i links oppure proseguire su tutte le pagine e poi nn lo so ;)
sai può darsi davvero che sia per quello, magari su questi siti non è presente il robot.txt e il wget si ferma alla index e alle immagini in essa contenute....

Inviato: gio 13 ott 2005, 12:22
da MAT
Se non fosse presente il robots.txt wget potrebbe scaricare tutto senza problemi.
Prova a vedere se esiste http://sito_che_da_problemi.org/robots.txt

Inviato: gio 13 ott 2005, 12:51
da strummer
ho controllato, ma il file robots.txt non è presente...