Adresele URL sunt diferite, dar conținutul paginii este același. Crezi că nu e mare lucru? Doar câteva pagini identice pe site. Dar conținutul duplicat poate fi filtrat de motoarele de căutare. Pentru a preveni acest lucru, trebuie să știi cum să elimini paginile duplicate interne.
Conceptul de pagini duplicate și tipurile acestora

Duplicatele sunt pagini individuale de site web al căror conținut este complet sau parțial identic. În esență, acestea sunt copii ale întregii pagini sau ale unei porțiuni specifice a acesteia, accesibile prin adrese URL unice.
Ce cauzează duplicatele pe un site web:
1. Generarea automată a paginilor duplicate de către sistemul de gestionare a conținutului (CMS) al site-ului web. De exemplu:
https://site.net/press-centre/cat/view/identifier/novosti/
https://site.net/press-centre/novosti/
2. Erori făcute de webmasteri. De exemplu, atunci când același produs este listat în mai multe categorii și accesibil la adrese URL diferite:
https://site.net/category-1/product-1/
https://site.net/category-2/product-1/
3. Modificarea structurii site-ului, atunci când paginilor existente li se atribuie adrese noi, dar duplicatele cu adrese vechi sunt păstrate. De exemplu:
https://site.net/catalog/product
https://site.net/catalog/category/product
Există două tipuri de duplicate: complete și parțiale.
Ce sunt interpretările complete?
Acestea sunt pagini cu conținut identic, accesibile la adrese URL unice și distincte. Exemple de duplicate complete:
1. Adresele URL ale paginilor cu și fără bare oblice („/”, „//”, „///”) la sfârșit:
https://site.net/catalog///product; https://site.net/catalog//////product.
2. Pagini HTTP și HTTPS: https//site.net; http//site.net.
3. Adrese cu „www” și fără „www”: http//www.site.net; http//site.net.
4. Adresele URL ale paginilor cu index.php, index.html, index.htm, default.asp, default.aspx, home:
https://site.net/index.html;
https://site.net/index.php;
https://site.net/home.
5. Adresele URL ale paginilor cu majuscule și minuscule:
https://site.net/exemplu/;
https://site.net/EXAMPLE/;
https://site.net/Example/.
6. Modificări în ierarhia URL-urilor. De exemplu, dacă un produs este disponibil la mai multe URL-uri diferite:
https://site.net/catalog/dir/tovar;
https://site.net/catalog/tovar;
https://site.net/tovar;
https://site.net/dir/tovar.
7. Parametri și etichete suplimentare în URL.
- URL cu parametri GET: https://site.net/index.php?example=10&product=25 . Pagina este complet identică cu următoarea: https://site.net/index.php?example=25&cat=10 .
- Prezența etichetelor UTM și a parametrilor gclid. Etichetele UTM ajută la furnizarea sistemelor de analiză cu informații pentru analizarea și urmărirea diverșilor parametri de trafic. Adresa URL a paginii de destinație la care sunt adăugate etichetele UTM arată astfel: https://www.site.net/?utm_source=adsite&utm_campaign=adcampaign&utm_term=adkeyword
- parametrii gclid (Identificator de clicuri Google). O etichetă URL țintă adăugată automat pentru a urmări datele despre companie, canal și cuvinte cheie în Google Analytics. De exemplu, dacă cineva dă clic pe anunțul dvs. pentru site-ul web https://site.net , adresa URL de destinație a vizitatorului va arăta astfel: https://site.net/?gclid=123xyz .
- Etichetă Openstat. Este universal și este folosit și pentru a analiza eficacitatea campaniilor publicitare, traficul site-ului web și comportamentul utilizatorilor. Legătură cu eticheta „openstat”: https://site.net/?_openstat=231645789.
- Duplicate create de un link de recomandare. Un link de recomandare este un link special cu ID-ul dvs. pe care site-urile web îl folosesc pentru a identifica referitorul unui vizitator nou. De exemplu: https://site.net/register/?refid=398992; https://site.net/index.php?cf=reg-newr&ref=Uncertainty.
8. Prima pagină a paginației catalogului de produse, a panoului de anunțuri sau a blogului unui magazin online. Adesea corespunde unei pagini de categorie sau paginii generale a secțiunii paginii: https://site.net/catalog; https://site.net/catalog/page1.
9. Setările incorecte de eroare 404 duc la numeroase duplicate. De exemplu: https://site.net/rococro-23489-rocoroc; https://site.net/8888-???.
Textul îngroșat poate conține simboluri și/sau numere. Paginile de acest tip ar trebui să returneze un cod de răspuns al serverului 404 (nu 200) sau să redirecționeze către pagina curentă.
Ce sunt luările parțiale?
Paginile parțial duplicate au același conținut, dar există mici diferențe în ceea ce privește elementele.
Tipuri de filmări parțiale:
1. Intrări duplicate pe fișele de produse și paginile de categorie (catalog). Aceste duplicate apar din descrierile produselor care apar pe pagina generală de produse a catalogului. Aceleași descrieri sunt prezente și pe paginile cu fișe de produse. De exemplu, în catalog, pagina de categorie a fiecărui produs conține o descriere a produsului respectiv:

Și același text pe pagina produsului:

Pentru a evita duplicatele, nu afișați informații complete despre produs pe pagina categoriei (catalogului). Sau folosiți o descriere unică.
2. Duplicate pe paginile de filtrare, sortare, căutare și paginare unde există conținut similar și se modifică doar ordinea. Textul descrierii și titlurile rămân neschimbate.
3. Duplicate pe pagini de tipărit sau descărcat, ale căror date corespund integral paginilor principale. De exemplu:
https://site.net/novosti/novost1
https://site.net/novosti/novost1/print
Duplicatele parțiale sunt mai greu de detectat. Cu toate acestea, consecințele lor sunt sistematice și au un impact negativ asupra clasamentului unui site.
Care sunt consecințele paginilor duplicate pe un site web?
Duplicatele pot apărea indiferent de vechimea sau numărul de pagini de pe un site web. Acestea nu vor împiedica vizitatorii să acceseze informațiile de care au nevoie. Situația este complet diferită în cazul crawlerelor motoarelor de căutare. Deoarece adresele URL sunt diferite, motoarele de căutare tratează aceste pagini ca fiind separate.
Consecința unei cantități mari de conținut duplicat este:
- Probleme cu indexarea. Generarea de pagini duplicate mărește dimensiunea totală a unui site web. Roboții care indexează aceste pagini „suplimentare” irosesc bugetul de crawl al proprietarului site-ului web.
- Paginile „necesare” s-ar putea să nu fie indexate deloc. Permiteți-mi să vă reamintesc că bugetul de crawl este numărul de pagini pe care un bot le poate scana într-o singură vizită pe un site.
- Modificări ale paginii relevante din rezultatele căutării. Algoritmul motorului de căutare poate decide că duplicatul este mai relevant pentru interogare. Prin urmare, va afișa o pagină diferită în rezultatele căutării față de cea destinată promovării. Un alt rezultat: din cauza concurenței dintre paginile duplicate, niciuna nu va apărea în rezultatele căutării.
- Pierderea greutății linkurilor paginilor promovate. Vizitatorii vor crea linkuri către pagini duplicate, în loc să le acceseze pe cele originale. Rezultatul este o pierdere a echității linkurilor naturale.
Catalog de instrumente pentru găsirea paginilor duplicate
Așadar, am discutat deja ce sunt duplicatele, ce tipuri au și la ce duc. Acum să trecem la modul de detectare a acestora. Iată câteva metode eficiente:
Găsirea duplicatelor folosind programe speciale
Netpeak Spider . Scanarea poate detecta pagini cu conținut duplicat: duplicate complete ale paginilor, duplicate ale paginilor pe baza conținutului blocului.< corp> , etichete duplicate de titlu și metaetichete de descriere.

Utilizarea operatorilor de căutare
Pentru a găsi duplicate, puteți analiza paginile care sunt deja indexate folosind operatorul de căutare „site:”. Pentru a face acest lucru, introduceți „site:examplesite.net” într-o bară de căutare, cum ar fi Google. Aceasta va afișa paginile site-ului în indexul general. De asemenea, va afișa numărul de pagini din rezultatele căutării, dacă acesta diferă semnificativ de numărul de pagini găsite de spider sau de pagini în harta site-ului XML.
Prin examinarea rezultatelor căutării, veți găsi pagini duplicate, precum și pagini „junk” care trebuie eliminate din index.

De asemenea, puteți utiliza funcția de căutare pentru a analiza rezultatele căutării pentru un anumit fragment de text din paginile pe care le suspectați că ar putea conține duplicate. Pentru a face acest lucru, includeți textul între ghilimele, urmat de un spațiu, operatorul „site:” și introduceți-l în bara de căutare. Va trebui să specificați site-ul web pentru a găsi pagini care conțin acest text specific. De exemplu:
„Un fragment de text dintr-o pagină web care poate conține duplicate” site:examplesite.net
Dacă rezultatele căutării afișează o singură pagină, atunci nu există duplicate. Dacă există mai multe pagini în rezultatele căutării, trebuie să le analizați și să determinați motivele conținutului duplicat. Acestea pot fi duplicate care trebuie eliminate.
În mod similar, folosind operatorul „intitle:”, analizăm conținutul „Titlului” de pe paginile din rezultatele căutării. „Titlurile” duplicate pot indica pagini duplicate. Pentru a verifica, folosim operatorul de căutare „site:”. Introducem o interogare de genul:
site:examplesite.net intitle:text complet sau parțial al etichetei Title.

Folosind operatorii „site” și „inurl”, puteți identifica paginile duplicate care au apărut pe paginile de sortare (sort) sau pe paginile de filtrare și căutare (filter, search).
De exemplu, pentru a căuta pagini sortate, trebuie să introduceți următoarele în bara de căutare: site:examplesite.net inurl:sort.
Pentru a găsi pagini de filtrare și căutare: site:examplesite.net inurl:filter,search.
Rețineți că motoarele de căutare afișează doar duplicatele care au fost deja indexate. Prin urmare, nu vă puteți baza în totalitate pe această metodă.
Cum să scapi de duplicate
Am abordat deja duplicatele, tipurile lor, consecințele lor și cum să le găsim. Acum să trecem la partea cea mai interesantă: cum să le împiedicăm să dăuneze optimizării. Vom folosi metode de eliminare a paginilor duplicate:
Redirecționare 301
Considerată principala metodă de eliminare a duplicatelor complete, o redirecționare 301 redirecționează automat o pagină a unui site web către alta. O redirecționare configurată le spune boților că pagina de la o anumită adresă URL nu mai este accesibilă și a fost mutată la o altă adresă.
Redirecționarea 301 vă permite să transferați link juice de pe pagina duplicată pe pagina principală.
Această metodă este relevantă pentru eliminarea duplicatelor care apar din cauza:
- URL în registre diferite;
- Ierarhii URL;
- determinarea oglinzii principale a site-ului;
- probleme cu utilizarea barelor oblice în adresele URL.
De exemplu, redirecționarea 301 este utilizată pentru a redirecționa de la pagini:
- https://site.net/catalog///product;
- https://site.net/catalog//////product;
- https://site.net/product către pagina https://site.net/catalog/product.
Fișierul Robots.txt
Această metodă ne permite să avertizăm roboții de căutare ce pagini sau fișiere nu ar trebui accesate cu crawlere.
Pentru a face acest lucru, trebuie să utilizați directiva „Disallow”, care împiedică roboții de căutare să viziteze pagini inutile.
Agent utilizator: *
Interzicere: /pagină
Rețineți că, dacă o pagină este listată în robots.txt cu o directivă Disallow, aceasta poate apărea în continuare în rezultatele căutării. De ce? Este posibil să fi fost indexată anterior sau pot exista linkuri interne sau externe care indică către aceasta. Instrucțiunile din Robots.txt sunt consultative pentru roboții de căutare și nu pot garanta eliminarea duplicatelor.
Metaetichetă< meta nume=\”roboți\” conținut=\”noindex, nofollow> Şi< meta name=\”roboți\” content=\”noindex, follow>
Metaetichetă Indică robotului să nu indexeze documentul sau să urmeze linkuri. Spre deosebire de robots.txt, această metaetichetă este o comandă directă și nu va fi ignorată de motoarele de căutare.
Metaetichetă instruiește robotul să nu indexeze documentul, ci să urmeze linkurile conținute în acesta.
Însă, așa cum relatează purtătorul de cuvânt al Google, John Mueller, mai devreme sau mai târziu metaeticheta „noindex, follow” este percepută de motorul de căutare ca „noindex, nofollow”.
Asta înseamnă că, dacă un bot vizitează pagina pentru prima dată și vede directiva „noindex, follow”, nu indexează pagina, dar există încă o șansă să dea clic pe link-uri interne. Totuși, dacă botul revine după un timp și vede din nou „noindex, follow”, pagina este complet eliminată din index, iar botul nu o mai vizitează și nu mai numără link-urile de pe ea. Asta înseamnă că, pe termen lung, nu există nicio diferență între metaetichetele „noindex, follow” și „noindex, nofollow”.
Pentru a utiliza metoda, trebuie să o plasați pe paginile duplicate din bloc.< cap> una dintre metaetichetele:
<meta nume=\”roboți\” conținut=\”noindex, nofollow\” /> sau similar:< meta nume=\”roboți\” conținut=\”niciunul\” /> ;< meta name=\”roboți\” content=\”noindex, follow\” /> .
Atributul rel=\”canonical\”
Folosește această metodă atunci când pagina nu poate fi ștearsă și trebuie lăsată deschisă pentru vizualizare.
O etichetă pentru eliminarea duplicatelor pe paginile de filtrare și sortare, paginile cu parametri GET și etichetele UTM. Este utilizată pentru imprimare, atunci când se utilizează același conținut informativ în versiuni lingvistice diferite și pe domenii diferite. Atributul rel=”canonical” pentru domenii diferite nu este acceptat de toate motoarele de căutare. Google îl va înțelege.
Prin specificarea unui link canonic, specificăm adresa paginii preferate pentru indexare. De exemplu, un site web are o categorie „Laptopuri”. Aceasta conține filtre care afișează diverși parametri de selecție, cum ar fi marca, culoarea, rezoluția ecranului, materialul carcasei și așa mai departe. Dacă aceste pagini filtrate nu urmează să fie promovate, specificăm pagina categoriei generale drept link canonic pentru ele.
Cum configurez o pagină canonică? Plasați atributul rel=”canonical” între etichetele … din codul HTML al paginii curente.
De exemplu, pentru pagini:
- https://site.net/index.php?example=10&product=25;
- https://site.net/example?filtr1=%5b%25D0%,filtr2=%5b%25D0%259F%;
- https://site.net/example/print.
Pagina canonică va fi https://site.net/example.
În cod HTML va arăta astfel: <link rel=\”canonical\” href=\”https://site.net/example\” /> .

Concluzii
1. Duplicatele sunt pagini web separate al căror conținut este complet sau parțial identic.
2. Motivele apariției duplicatelor pe un site web: generare automată, erori făcute de webmasteri, modificări ale structurii site-ului web.
3. La ce duc duplicatele de pe un site web: indexarea se înrăutățește; pagina relevantă din rezultatele căutării se modifică; pierderea masei de linkuri naturale pentru paginile promovate.
4. Metode de căutare a duplicatelor: utilizarea programelor de parser (Netpeak Spider); operatorul de căutare site.
5. Instrumente de eliminare a duplicatelor: comenzi relevante în fișierul robots.txt; meta name tag=\”robots\” content=\”noindex, nofollow\”; rel tag=\”canonical\”; redirecționare 301.
Ați eliminat conținutul duplicat? Acum este momentul să vă verificați din nou site-ul. Acest lucru vă va ajuta să vedeți eficacitatea acțiunilor dvs. și să evaluați eficiența metodei alese. Vă recomandăm să analizați periodic site-ul pentru duplicate. Aceasta este singura modalitate de a identifica și corecta erorile prompt.
Sursă: Netpeak


