stranezze di wget -m

Postate qui per tutte le discussioni legate a Linux in generale.

Moderatore: Staff

Regole del forum
1) Citare sempre la versione di Slackware usata, la versione del Kernel e magari anche la versione della libreria coinvolta. Questi dati aiutano le persone che possono rispondere.
2) Per evitare confusione prego inserire in questo forum solo topic che riguardano appunto Gnu/Linux in genere, se l'argomento è specifico alla Slackware usate uno dei forum Slackware o Slackware64.
3) Leggere attentamente le risposte ricevute
4) Scrivere i messaggi con il colore di default, evitare altri colori.
5) Scrivere in Italiano o in Inglese, se possibile grammaticalmente corretto, evitate stili di scrittura poco chiari, quindi nessuna abbreviazione tipo telegramma o scrittura stile SMS o CHAT.
6) Appena registrati è consigliato presentarsi nel forum dedicato.

La non osservanza delle regole porta a provvedimenti di vari tipo da parte dello staff, in particolare la non osservanza della regola 5 porta alla cancellazione del post e alla segnalazione dell'utente. In caso di recidività l'utente rischia il ban temporaneo.
Rispondi
strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

stranezze di wget -m

Messaggio da strummer »

ciao a tutti,
Leggendo il man di wget e gli altri post presenti qui, ho appunto riscontrato che è l'opzione -m quella utile a scaricare tutto un sito....
ho notato però, che il comando wget -m o wget -r usato per scaricare interi siti, non funziona con tutti alla perfezione, ma con alcuni ne scarica solo una parte?
come mai?
Grazie

Avatar utente
prometeo79
Linux 4.x
Linux 4.x
Messaggi: 1278
Iscritto il: gio 17 mar 2005, 0:00
Slackware: 12
Località: Torino

Messaggio da prometeo79 »

Mi hai preceduto col post. Stessa identica cosa, anzi a me -r non scarica praticamente nulla.

Avatar utente
MAT
Linux 4.x
Linux 4.x
Messaggi: 1242
Iscritto il: mer 9 mar 2005, 0:00
Nome Cognome: Matteo Magni
Kernel: 2.6.20
Desktop: Fluxbox
Distribuzione: Gentoo
Località: Vignola, Modena

Messaggio da MAT »

Da `man wget`:

Codice: Seleziona tutto

       -l depth
       --level=depth
           Specify recursion maximum depth level depth.  The
           default maximum depth is 5.

strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

Messaggio da strummer »

provato anche quello, ma niente da fare!

Bart
Staff
Staff
Messaggi: 4249
Iscritto il: lun 9 ago 2004, 0:00
Località: Rimini

Messaggio da Bart »

Dal libro Slackware Linux Essentials, per scaricare un intero sito:

Codice: Seleziona tutto

wget --recursive <url>
wget creerà una directory col nome del sito contenente il sito stesso.

strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

Messaggio da strummer »

wget --recursive è come -r, purtroppo anche con quello non mi fa, o meglio sia -r che -m fanno nella maggior parte dei casi, ma con alcuni no.
Grazie x ora comunque...

Avatar utente
MAT
Linux 4.x
Linux 4.x
Messaggi: 1242
Iscritto il: mer 9 mar 2005, 0:00
Nome Cognome: Matteo Magni
Kernel: 2.6.20
Desktop: Fluxbox
Distribuzione: Gentoo
Località: Vignola, Modena

Messaggio da MAT »

Bè, io con

Codice: Seleziona tutto

wget -r -l 0 http://mywebsite.org
ho scaricato un sito intero... e a te non va?

strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

Messaggio da strummer »

mah guarda..., come ripeto, tutte queste opzioni funzionano, ma su alcuni siti no, mi stavo chiedendo se a volte nn fosse colpa del codice html, php o javascript di taluni siti... :?: magati ho detto una bischerata, ma a questo punto nn lo so...
ciao

Avatar utente
MAT
Linux 4.x
Linux 4.x
Messaggi: 1242
Iscritto il: mer 9 mar 2005, 0:00
Nome Cognome: Matteo Magni
Kernel: 2.6.20
Desktop: Fluxbox
Distribuzione: Gentoo
Località: Vignola, Modena

Messaggio da MAT »

Aspetta... wget rispetta il robots.txt!! Non è che la colpa è di quello??

strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

Messaggio da strummer »

Già!! se non sbaglio, il robot.txt, dice cosa fare ai "ragnetti" dei motori di ricerca, tipo seguire i links oppure proseguire su tutte le pagine e poi nn lo so ;)
sai può darsi davvero che sia per quello, magari su questi siti non è presente il robot.txt e il wget si ferma alla index e alle immagini in essa contenute....

Avatar utente
MAT
Linux 4.x
Linux 4.x
Messaggi: 1242
Iscritto il: mer 9 mar 2005, 0:00
Nome Cognome: Matteo Magni
Kernel: 2.6.20
Desktop: Fluxbox
Distribuzione: Gentoo
Località: Vignola, Modena

Messaggio da MAT »

Se non fosse presente il robots.txt wget potrebbe scaricare tutto senza problemi.
Prova a vedere se esiste http://sito_che_da_problemi.org/robots.txt

strummer
Linux 2.x
Linux 2.x
Messaggi: 276
Iscritto il: mer 29 set 2004, 0:00

Messaggio da strummer »

ho controllato, ma il file robots.txt non è presente...

Rispondi