Pentru cei care nu stiu ce face un crawler web voi spune in cateva cuvinte ca poate prelucra documente de tipul XML pe care le parseaza, pe baza unui URL indicat, mai exact putem cu ajutorul lui sa extragem si sa prelucram anumite informatii.
Ce trebuie sau ar trebui sa faca un crawler web?
In primul rand, trebuie sa respecte politica fiecarui site web si, bineinteles, sa foloseasca doar paginile unde este permis acest lucru. Un webmaster poate specifica ce portiuni din site pot fi accesate de crawler, iar crawler-ul trebuie sa respecte aceste indicatii. Chiar daca aceste specificatii nu exista, este bine sa nu fie accesat foarte des acelasi site de catre crawler, exceptie facand site-urile de stiri unde continutul se schimba foarte des.
Este foarte important ca un crawler web sa fie imun la paginile cu "capcane", inclusiv cele generate dinamic, si la paginile spam.
Un crawler bun este capabil sa ruleze pe mai multe masini distribuite si sa fie scalabil. De asemenea, va permite folosirea completa a resurselor.
Pentru a avea o eficienta cat mai buna, crawler-ul va folosi mai intai paginile de calitate mai buna si va face continuu refresh, in cazul in care apar copii mai noi ale acestora.
Nu ar fi rau nici sa fie extensibil si sa se poata adapta la formate de date si protocoale diferite.
Care sunt pasii pe care ii urmeaza un crawler web?
Initial, ia URL-ul si documentul care se gaseste la URL-ul respectiv. Urmeaza parsarea documentului/documentelor. Apoi se verifica daca a fost deja vazut continutul URL-ului respectiv. In caz contrar, este adaugat la index. Pentru fiecare URL extras se verifica daca trece anumite teste de filtrare si daca nu cumva exista un duplicat al acestuia.
In final, daca doriti sa vedeti implementarea unui crawler care analizeaza relatiile sociale dintr-o comunitate web va invitam pe site-ul nostru.
XML (Extensible Markup Language) este folosit pentru crearea de limbaje de marcare si poate fi clasificat drept un limbaj extensibil deoarece le permite utilizatorilor sai sa-si defineasca propriile elemente.Principalele lui scopuri sunt de a ajuta transferul de date structurate intre aplicatii pe Internet, de a coda documente si de a serializa date.
Ce face XML?
XML poate fi folosit pentru a structura datele, folosind regulile care il definesc, dar nu este un limbaj de programare si poate fi deci folosit de oricine, fara a avea cunostinte de programare.
Alta facilitate a XML este aceea ca permite utilizatorului sa combine mai multe formate, obtinand astfel un format nou de fisier. Totusi, pot aparea confuzii daca de exemplu doua elemente au acelasi nume. In acest caz XML ne vine in ajutor cu mecanismul "namespace" sau domenii pentru nume (vezi XLS, RDF).
Asemanator cu HTML, XML foloseste tag-uri si atribute, acestea avand rolul de a delimita datele pentru a putea fi interpretate de aplicatii, in timp ce in HTML folosesc pentru aranjarea textului in browser.
XML mai poate fi folosit pentru a crea XHTML. Cum? Se ia un fisier HTML, i se schimba sintaxa atat cat este nevoie pentru a corespunde regulilor XML (vezi corectitudinea unui fisier XML) si s-a obtinut XHTML-ul.
In ceea ce priveste corectitudinea unui document XML, acesta trebuie sa respecte doua conditii:
- sa fie bine-format: sa respecte toate regulile de sintaxa. De exemplu: daca un start-tag nu are un end-tag corespunzator, documentul nu este bine format si nu va fi considerat XML
- sa fie valid: trebuie sa respecte cateva reguli semantice aditionale. De exemplu: un document ce contine un element nedefinit nu este valid
HTML este utilizat pentru:
- a afisa datele
- a defini vizual datele
- a arata cum sunt afisate datele
- a transporta datele
- a descrie datele
- a arata cum sunt utilizate datele
Postări mai vechi Pagina de pornire