Pagina 1 di 1

trovare file duplicati

Inviato: ven 12 set 2008, 15:53
da sbabaro
Vorrei mettere un poco di ordine tra i vari backup, dischi esterni, recovery di crash, etc. facendo dei confronti massivi dei file e cancellare quelli duplicati
ho cercato qualche software ma, a parte la lentezza, sono mezzi bacati e non risultano utilizzabili
avete suggerimenti?
Offtopic: forse dovevo aprire il post su linux generico????

Re: trovare file duplicati

Inviato: ven 12 set 2008, 17:01
da Blizzard
ciao,
non so che software possa fare una cosa simile ma nel caso peggiore puoi fare un programma o uno script tu (certo non so la velocità :( )

ad esempio diff produce codice di uscita 0 se i files sono uguali e codice di uscita !=0 se sono diversi (1 per i text e 2 per i bin)
potresti fare uno script del tipo (non so scriverti il codice):

Codice: Seleziona tutto

for each file1 in dir
{
    for each file2 in dir
    {
        if file2==file1 then continue;
        diff file1 file2;
        if $? == 0 then print file1 is equal file2
    }
}
tanto per fare uno pseudocodice ma penso sia inutile citarti la complessità computazionale di una roba simile :oops:
tieni conto che questo sistema non calcola i duplicati gia trovati per evitare di ricontrollare (ma questo è un problema semplice da tirar via)

Gio

Re: trovare file duplicati

Inviato: ven 12 set 2008, 17:55
da Burroughs
In alternativa a quanto ti suggeriva l'ottimo Blizzard, puoi utilizzare kleansweep, che dovrebbe fare al caso tuo.
Lo trovi nel repository.

Burroughs.

Re: trovare file duplicati

Inviato: ven 12 set 2008, 18:21
da conraid
fdupes lo hai provato?

Re: trovare file duplicati

Inviato: ven 12 set 2008, 18:45
da Mario Vanoni
Esiste anche dircmp(1)
su internet versioni libere
uso la versione proprietaria AT&T ereditata

per confrontare le dir di due maccchine
ottimo arnese

Re: trovare file duplicati

Inviato: ven 12 set 2008, 20:52
da kobaiachi
invece che diff usa un hash secondo me fai prima

Re: trovare file duplicati

Inviato: sab 13 set 2008, 12:55
da sbabaro
ragazzi grazie dei consigli.
La strada dello script con diff lo escluderei, vista la mole di dati da verificare
mi metterò a provare i software
Vi faccio sapere come è andata
=D> a voi