Pagina 1 di 1

NFS _estremamente_ lento

Inviato: sab 11 nov 2006, 16:00
da g4b0
Ciao a tutti,
sulla mia lan ho una macchina che condivide una directory mediante nfs:

Codice: Seleziona tutto

g4b0@sun:/etc$ more exports
# See exports(5) for a description.
# This file contains a list of all directories exported to other computers.
# It is used by rpc.nfsd and rpc.mountd.

/multimedia        192.168.0.2(rw,async) 192.168.1.3(rw,async) 192.168.1.2(rw,async)
Ed un'altra macchina che dovrebbe usurfruire dei file nella directory, montandola in questo modo:

Codice: Seleziona tutto

root@slak102:/home/g4b0# more /etc/fstab
/dev/hda2        swap             swap        defaults         0   0
/dev/hda6        /                reiserfs    defaults         1   1
/dev/hda3        /boot            reiserfs    defaults         1   2
/dev/hda5        /home            reiserfs    defaults         1   2
/dev/hda7        /scambio         vfat        defaults         1   0
/dev/hda1        /xp              ntfs        ro               1   0
/dev/cdrom       /mnt/cdrom       auto        noauto,owner,ro  0   0
/dev/fd0         /mnt/floppy      auto        noauto,owner     0   0
devpts           /dev/pts         devpts      gid=5,mode=620   0   0
proc             /proc            proc        defaults         0   0
192.168.0.100:/multimedia /mnt/multimedia nfs auto,users,exec  0   0
Il problema è che nfs è estremamente lento, ad es con xmms non riesco assolutamente a riprodurre mp3, e spesso mi si schianta pure konqueror, ed anche un ls-l rischia di piantarmi la shell stessa!! Dove sbaglio?

Grazie per l'aiuto
g4b0

Inviato: sab 11 nov 2006, 18:16
da gastone90
potrebbe essere che hai una scheda lan vecchia....possibile?

Inviato: sab 11 nov 2006, 18:38
da simplex
Secondo me e' un problema hardware, peche' io faccio piu' o meno la stessa on con nfs e va da dio

Inviato: mar 14 nov 2006, 19:01
da g4b0
In effetti potrebbe essere un problema hw...

Mi spiego meglio: la macchina 'server' ha 2sk di rete: una ethernet (192.168.0.100) e l'altra wifi (192.168.1.100). La prima è collegata con un cavo cross verso la macchina client (192.168.0.2), mentre la seconda naviga tramite il mio access poin wifi.

Oltre ad avere il problema dell'nfs lento, mi si presenta pure questo altro problema: amule si schianta dopo un paio di giorni, se faccio

Codice: Seleziona tutto

ps aux | grep amule
mi trovo il processo con questa dicitura: <defunct>, e dopo un po' di ssh mi si blocca tutto e devo riavviare la macchina server (dato che non ha tastiera e monitor)

?? boh ??
Devo provare a cambiare la sk di rete ethrnet? o forse è la wifi che da problemi?

g4b0

Inviato: mar 14 nov 2006, 19:30
da bloodlust
hai controllato nei log di sistema se ti compaiono degli errori hw? errori di irq? hai controllato eventualmente velocità e se full o half duplex della cablata? (anche io però sono più propenso ad un problema hardware della scheda)

Inviato: mer 15 nov 2006, 19:10
da g4b0
Ed ecco il mio syslog in concomitanza con un crash di amule:

Codice: Seleziona tutto

root@sun:/var/log# more syslog
Nov 13 07:03:50 sun kernel: Unable to handle kernel paging request at virtual address 3152b000
Nov 13 07:03:50 sun kernel:  printing eip:
Nov 13 07:03:50 sun kernel: 3152b000
Nov 13 07:03:50 sun kernel: *pde = 00000000
Nov 13 07:03:50 sun kernel: Oops: 0000 [#1]
Nov 13 07:03:50 sun kernel: Modules linked in: lp parport nfsd exportfs lockd sunrpc ipv6 ohci_hcd ehc
i_hcd zd1211 via_agp uhci_hcd i2c_viapro i2c_core 8139too mii matrox_w1 wire agpgart psmouse
Nov 13 07:03:50 sun kernel: CPU:    0
Nov 13 07:03:50 sun kernel: EIP:    0060:[<3152b000>]    Not tainted VLI
Nov 13 07:03:50 sun kernel: EFLAGS: 00010206   (2.6.13)
Nov 13 07:03:50 sun kernel: EIP is at 0x3152b000
Nov 13 07:03:50 sun kernel: eax: d78465a3   ebx: cfe0fde8   ecx: c11fcbe0   edx: 3152b000
Nov 13 07:03:50 sun kernel: esi: cfe0fdf0   edi: c1300be0   ebp: 00000000   esp: cfe0fd90
Nov 13 07:03:50 sun kernel: ds: 007b   es: 007b   ss: 0068
Nov 13 07:03:50 sun kernel: Process amuled (pid: 3304, threadinfo=cfe0e000 task=cfeaf590)
Nov 13 07:03:50 sun kernel: Stack: c0152b74 d78465a3 c11fcbe0 c0133503 c11fcbe0 c0504575 c11fcbe0 c013
34c0
Nov 13 07:03:50 sun kernel:        c11fcbe0 cfe0fde4 cfe0fe04 cfe0fde8 c0133bfe 00000002 c11fcbe0 0000
0000
Nov 13 07:03:50 sun kernel:        00000000 cfeaf590 c012a030 cfe0fdfc cfe0fdfc c11fcbe0 c11fcbe0 0000
0000
Nov 13 07:03:50 sun kernel: Call Trace:
Nov 13 07:03:50 sun kernel:  [<c0152b74>] block_sync_page+0x44/0x50
Nov 13 07:03:50 sun kernel:  [<c0133503>] sync_page+0x43/0x50
Nov 13 07:03:50 sun kernel:  [<c0504575>] __wait_on_bit_lock+0x65/0x80
Nov 13 07:03:50 sun kernel:  [<c01334c0>] sync_page+0x0/0x50
Nov 13 07:03:50 sun kernel:  [<c0133bfe>] __lock_page+0x6e/0x80
Nov 13 07:03:50 sun kernel:  [<c012a030>] wake_bit_function+0x0/0x40
Nov 13 07:03:50 sun kernel:  [<c012a030>] wake_bit_function+0x0/0x40
Nov 13 07:03:50 sun kernel:  [<c01922df>] reiserfs_readpage+0xf/0x20
Nov 13 07:03:50 sun kernel:  [<c0134297>] do_generic_mapping_read+0x377/0x4b0
Nov 13 07:03:50 sun kernel:  [<c0134680>] __generic_file_aio_read+0x1d0/0x210
Nov 13 07:03:50 sun kernel:  [<c01343d0>] file_read_actor+0x0/0xe0
Nov 13 07:03:50 sun kernel:  [<c01347cb>] generic_file_read+0xab/0xd0
Nov 13 07:03:50 sun kernel:  [<c015fcc3>] do_select+0x1a3/0x2d0
Nov 13 07:03:50 sun kernel:  [<c015f970>] __pollwait+0x0/0xa0
Nov 13 07:03:50 sun kernel:  [<c0129ff0>] autoremove_wake_function+0x0/0x40
Nov 13 07:03:50 sun kernel:  [<c014e47f>] vfs_read+0x9f/0x150
Nov 13 07:03:50 sun kernel:  [<c014e7cd>] sys_read+0x3d/0x70
Nov 13 07:03:50 sun kernel:  [<c0102ea9>] syscall_call+0x7/0xb
Nov 13 07:03:50 sun kernel: Code:  Bad EIP value.
Nov 13 19:19:23 sun kernel:  <6>eth0: link up, 100Mbps, full-duplex, lpa 0x41E1

[ ... prosegue ... ]

nei moduli c'è (ovviamente) zd1211, che è il driver sello schedino wifi usb (uno us robotics). E' inoltre evidenziato il crash di amuled.
Mi è venuto da pensare che le cause possono essere molteplici:

1) RAM (ne ho aggiunto un banco da 6 mesi circa, ma non ho mai avuto problemi)
2) Processore (in 6 anni di onorato servizio mai un problema)
3) HDD (in effetti potrebbe essere lui, dato il pesante I/O di amuled, ma il test della matrox mi dice che è tutto ok)
4) sk di rete (come si diceva prima, ma io ne dubito, sinceramente)
5) In ultimo potrebbe anche essere un problema sw, c'è modo di verificare se le varie glibc, e company sono ok, tipo un sanity check software, o qualcosa del genere?

Non dimentichiamo che non è solo un problema di amuled, ma mi si schianta anche spesso su nfs (la directory esportata sta sullo stesso disco su cui fa I/O amuled), ed ssh a volte resta un poi' in standby (ma questo penso sia solo un side-effect).

Voi che ne dite?
butto tutto ed installo vista su un nuovo pc con 30 Gb di ram? :lol:

g4b0

Inviato: mer 15 nov 2006, 19:13
da g4b0
p.s.

Adesso ho amuled che sbranza a tutta banda, e, se si comporta come al solito, farà così per cisrca 2-3gg... poi muore loggando quanto sopra...


g4b0

Inviato: mer 15 nov 2006, 19:18
da gastone90
ma guarda che emule dopo un po ti incasina il router eh..

Inviato: gio 16 nov 2006, 9:15
da g4b0
In che senso? Il router va che è una meraviglia, lo uso anche da un'altra macchina che naviga tranquillamente bene, l'unico inconveniente è che ogni tanto (circa ogni 30gg) il router perde l'ip, si schianta e mi tocca riavviarlo. Penso comunque che questo sia uno scherzetto che mi fa telecom, in quanto non ho un ip fisso ed in qualche modo me lo devono rendere dinamico, dato che con amule a palla non mi disconnetto mai...

comunque il problema sta sul 'server', con l'errore nel syslog postato sopra.. Che ne pensate?

Inviato: gio 16 nov 2006, 9:21
da simplex
Si', capita anche a me sta cosa degli ip

Inviato: gio 16 nov 2006, 14:14
da g4b0
ulteriori info, ora mi sembra quasi che il problema derivi da NFSD!!
Allego il syslog relativo al riavvio del server dopo il crash di amuled:

Codice: Seleziona tutto

ov 14 19:02:15 sun kernel: NFSD: Using /var/lib/nfs/v4recovery as the NFSv4 state recovery directory
Nov 14 19:02:15 sun kernel: NFSD: recovery directory /var/lib/nfs/v4recovery doesn't exist
Nov 14 19:02:15 sun kernel: NFSD: starting 90-second grace period
Nov 14 19:02:55 sun smbd[3188]: [2006/11/14 19:02:55, 0] param/loadparm.c:map_parameter(2690)
Nov 14 19:02:55 sun smbd[3188]:   Unknown parameter encountered: "SO_RCVBUF"
Nov 14 19:02:55 sun smbd[3188]: [2006/11/14 19:02:55, 0] param/loadparm.c:lp_do_parameter(3420)
Nov 14 19:02:55 sun smbd[3188]:   Ignoring unknown parameter "SO_RCVBUF"
Nov 14 19:02:56 sun nmbd[3208]: [2006/11/14 19:02:56, 0] param/loadparm.c:map_parameter(2690)
Nov 14 19:02:56 sun nmbd[3208]:   Unknown parameter encountered: "SO_RCVBUF"
Nov 14 19:02:56 sun nmbd[3208]: [2006/11/14 19:02:56, 0] param/loadparm.c:lp_do_parameter(3420)
Nov 14 19:02:56 sun nmbd[3208]:   Ignoring unknown parameter "SO_RCVBUF"
Nov 14 19:08:33 sun nmbd[3209]: [2006/11/14 19:08:33, 0] nmbd/nmbd_become_lmb.c:become_local_master_st
age2(396)
Nov 14 19:08:33 sun nmbd[3209]:   *****
Nov 14 19:08:33 sun nmbd[3209]:
Nov 14 19:08:33 sun nmbd[3209]:   Samba name server SUN is now a local master browser for workgroup MS
HOME on subnet 192.168.0.100
Nov 14 19:08:33 sun nmbd[3209]:
Nov 14 19:08:33 sun nmbd[3209]:   *****
Nov 14 19:08:33 sun nmbd[3209]: [2006/11/14 19:08:33, 0] nmbd/nmbd_become_lmb.c:become_local_master_st
age2(396)
Nov 14 19:08:33 sun nmbd[3209]:   *****
Nov 14 19:08:33 sun nmbd[3209]:
Nov 14 19:08:33 sun nmbd[3209]:   Samba name server SUN is now a local master browser for workgroup MS
HOME on subnet 192.168.1.100
Nov 14 19:08:33 sun nmbd[3209]:
Nov 14 19:08:33 sun nmbd[3209]:   *****
Sembrano esserci alcuni errori su samba (che però funziona egregiamente) e su NFSD (che invece si schianta).
Voi che ne dite?

g4b0

Inviato: gio 16 nov 2006, 15:11
da bloodlust
ov 14 19:02:15 sun kernel: NFSD: Using /var/lib/nfs/v4recovery as the NFSv4 state recovery directory
Nov 14 19:02:15 sun kernel: NFSD: recovery directory /var/lib/nfs/v4recovery doesn't exist
Nov 14 19:02:15 sun kernel: NFSD: starting 90-second grace period
basta che crei la directory indicata e il delay (come anche la segnalazione) spariscono.

Inviato: gio 16 nov 2006, 15:56
da g4b0
ma secondo te può essere questo a schiantarmi nfs?

Inviato: gio 16 nov 2006, 19:47
da g4b0
Sono 48h che amuled non si schianta... buon segno!!! :badgrin:

Però nfsd continua a non funzionare, ho creato la directory che dice di non trovare nei log e, riavviandolo, ottengo questi log:

Codice: Seleziona tutto

ov 16 19:23:09 sun rpc.statd[5001]: Caught signal 15, un-registering and exiting.
Nov 16 19:23:09 sun rpc.mountd: Caught signal 15, un-registering and exiting.
Nov 16 19:23:10 sun kernel: nfsd: last server has exited
Nov 16 19:23:10 sun kernel: nfsd: unexporting all filesystems
Nov 16 19:23:10 sun kernel: RPC: failed to contact portmap (errno -5).
Nov 16 19:24:09 sun kernel: NFSD: Using /var/lib/nfs/v4recovery as the NFSv4 state recovery directory
Nov 16 19:24:09 sun kernel: NFSD: starting 90-second grace period
a questo punto monto la directory, ci entro, lavoro per qualche secondo e... crash, il client di impalla!! ed il server non accetta più connessioni!!
Potrebbe essere secondo voi un bug di nfs che non gestisce i 113Gb di dati che gli faccio esportare?

g4b0

Inviato: sab 18 nov 2006, 16:55
da pepe.carvalho
g4b0 ha scritto:Sono 48h che amuled non si schianta... buon segno!!! :badgrin:

Però nfsd continua a non funzionare, ho creato la directory che dice di non trovare nei log e, riavviandolo, ottengo questi log:

Codice: Seleziona tutto

ov 16 19:23:09 sun rpc.statd[5001]: Caught signal 15, un-registering and exiting.
Nov 16 19:23:09 sun rpc.mountd: Caught signal 15, un-registering and exiting.
Nov 16 19:23:10 sun kernel: nfsd: last server has exited
Nov 16 19:23:10 sun kernel: nfsd: unexporting all filesystems
Nov 16 19:23:10 sun kernel: RPC: failed to contact portmap (errno -5).
Nov 16 19:24:09 sun kernel: NFSD: Using /var/lib/nfs/v4recovery as the NFSv4 state recovery directory
Nov 16 19:24:09 sun kernel: NFSD: starting 90-second grace period
g4b0
Io avevo problemi simili ai tuoi connettendo il mio client alla LAN.
Il problema era : mancanza di portmap (che deve essere installato e running) e del demone lockd.
hope this helps
fammi sapere