संक्षेप में जवाब
3310 के केवल 738 पृष्ठों को अनुक्रमित किया गया था। हमने खोज कंसोल रिपोर्ट खोली, शेष को दस कारणों से सॉर्ट किया और पाया कि 43% साइटमैप एक सेक्शन गूगल को क्रॉल करने से इंकार कर दिया गया।
इसके साथ शुरू हुई संख्या
गूगल सर्च कंसोल में पृष्ठ अनुक्रमण रिपोर्ट में दो आंकड़े पक्ष में डाल दिए गए हैं। Ours read: 738 पृष्ठों अनुक्रमित, 2572 अनुक्रमित नहीं। गूगल इस साइट पर लगभग 3310 पते जानता है। उनमें से बीस प्रतिशत ने इसे खोज में बनाया।
अपने आप में एक खाई एक फैसले नहीं है। एक युवा डोमेन लगभग हमेशा आंशिक रूप से अनुक्रमित होता है - एक खोज इंजन को एक साइट पर भरोसा करने का कोई कारण नहीं है जो छह महीने पहले हुई थी जिस तरह से यह इतिहास के एक दशक के साथ एक पर भरोसा करता है। कुछ पन्नों को जानबूझकर अनुक्रमित करने के लिए बंद कर दिया गया है, कुछ लोग प्रशासनिक हैं।
लेकिन एक चार और एक आधा गुना अंतर अब शोर नहीं है। जब तीन हजार पतों की तुलना में कम खोज तक पहुंच जाता है, तो आप कारण से टूटने को खोलते हैं और इसे सामान्य सलाह से अनुमान लगाने के बजाय लाइन में पढ़ते हैं।
क्या इस प्रकार है कि ब्रेकडाउन, हमारे स्वयं के आंकड़ों के साथ, हम जिस तरह से गलती करते थे, और जो ठीक काम करता था। कुछ भी सैद्धांतिक: यह सब एक सप्ताह के अंदर इस साइट पर हुआ।
दस कारण और वे बराबर नहीं हैं
रिपोर्ट में अनुक्रमित पृष्ठों को श्रेणियों में क्रमबद्ध किया गया है। हमारे पास दस है, और समझने की पहली बात यह है कि वे वजन में काफी भिन्न होते हैं। आधे को सुरक्षित रूप से अनदेखा किया जा सकता है।
Redirect — 27 पतों के साथ पृष्ठ। सामान्य साइट व्यवहार: एक नए पते पर एक पुराना पता इंगित करता है, क्रॉलर इसे नोट करता है और चलता है। ठीक करने के लिए कुछ नहीं।
वैकल्पिक पृष्ठ के साथ उचित कैनोनिकल टैग - 16 पते। इसके अलावा सामान्य: एक पृष्ठ के कई संस्करण मौजूद हैं, आपने प्राथमिक नाम दिया है, और क्रॉलर आपको सुना है।
Noindex टैग - 132 पते से बाहर निकला। यदि आप उन पृष्ठों को उद्देश्य पर बंद कर देते हैं तो यह सामान्य हो सकता है। हमारी पत्रिका के संपादकीय फ़िल्टर द्वारा बंद हैं: टुकड़े जो गहराई पर गिरते हैं या सोर्सिंग खोज में प्रवेश नहीं करते हैं। यह केवल एक समस्या होगी अगर कुछ वहाँ उतर गया है कि हम कभी बंद नहीं थे।
रोबोट द्वारा अवरुद्ध.txt - 5 पते। प्रशासनिक अनुभाग Intended.
शेष तीन श्रेणियों में जहां वास्तविक बातचीत शुरू होती है।
वास्तव में अनुक्रमित नहीं
वाक्यांश का मतलब यह है: क्रॉलर पहुंचे, पृष्ठ को पूर्ण रूप से पढ़ें और इसके खिलाफ फैसला किया। नहीं, नहीं पता था - निर्णय लिया।
हमारे पास यहां 383 पृष्ठ थे और तीस-दो और एक दिन के भीतर दिखाई दिए। हमने जल्दी ही कारण पाया क्योंकि हम जल्द ही उत्पाद पृष्ठों पर काम कर रहे थे।
रूसी उत्पाद विवरण अंग्रेजी नाम और एक अनुवादित श्रेणी से फ्लाई पर इकट्ठा किया गया था। परिणाम इस तरह की श्रेणी, शांत सिल्हूट, गुणवत्ता सामग्री में एक माना जाता डिजाइन की तरह पढ़ा। सभी सोलह उत्पादों में समान वाक्य, दो शब्दों को बदलने के साथ।
एक खोज इंजन के लिए जो सोलह निकटवर्ती पृष्ठ है। यह पहली बार पढ़ा जाता है, दूसरा, तीसरा, और बाकी को रखने के बिंदु को देखना बंद कर देता है। वास्तव में यह एक आपूर्तिकर्ता से कॉपी किए गए विवरणों के साथ होता है: यदि एक पाठ सौ साइटों पर बैठता है, तो उनमें से कोई भी लाभ प्राप्त नहीं करता है।
प्रत्येक पृष्ठ पर एक इलाज - अद्वितीय पाठ है। समानार्थी के साथ फिर से लिखा नहीं है, लेकिन विशिष्ट आइटम के बारे में लिखा: यह क्या है, यह क्या है, यह क्या है, इसके साथ क्या होता है, यह कैसे सूची में इसके बगल में टुकड़ा से भिन्न होता है।
क्यों हम खुद को खोजने के लिए कुछ पृष्ठों को बंद करते हैं
क्योंकि 132 बंद पते एक oversight की तरह दिखते हैं और वास्तव में हम जानबूझकर एक नियम लिखा है।
जर्नल एक संपादकीय फ़िल्टर चलाता है: लगभग बीस-पाँच की स्थिति एक टुकड़ा खोज में प्रवेश करने से पहले संतुष्ट होना चाहिए। न्यूनतम लंबाई, प्रति भाषा अलग से सेट। दो स्वतंत्र डोमेन पर कम से कम दो स्रोत। पाठ के अंदर कोई दोहराया शीर्षक नहीं। प्राथमिक कीवर्ड घनत्व दो प्रतिशत से अधिक नहीं है।
एक ऐसा टुकड़ा जो फ़िल्टर को विफल करता है, अभी भी प्रकाशित और अभी तक पठनीय है, लेकिन इसमें noindex टैग शामिल हैं। एक पतली नोट खोज से बाहर रहता है और इसके साथ सेक्शन की प्रतिष्ठा नहीं खींचता है।
तर्क सरल है। एक सर्च इंजन न केवल व्यक्तिगत पृष्ठ बल्कि अनुभाग को पूरी तरह से न्याय करता है। एक सौ मजबूत टुकड़े और तीन सौ कमजोर लोग एक साइट है जहां पत्रिका के तीन चौथाई ध्यान देने योग्य नहीं है, और इसमें नए ग्रंथ धीरे-धीरे अनुक्रमित होते हैं। एक सौ मजबूत टुकड़े और तीन सौ बंद लोग एक साइट है जहां खोज में केवल वही है जो हम बचाव के लिए तैयार हैं।
अंतर यह है कि पहला संस्करण कुछ ऐसा है जो खोज इंजन खुद के लिए काम करता है और पूरे अनुभाग को सामान्य करता है। दूसरी बात यह है कि हम इसे पहले से बताते हैं।
वास्तव में क्या खोजा लेकिन अनुक्रमित नहीं है
यह श्रेणी पिछले एक की तुलना में भारी है, हालांकि यह सज्जन लगता है। इसका मतलब यह है कि क्रॉलर कभी नहीं आया। पता ज्ञात है - आपने इसे अपनी साइटमैप में प्रस्तुत किया - लेकिन इसके लिए कोई क्रॉल आवंटित नहीं किया गया था।
हमारे पास 1331 पते थे। एक दिन पहले वहाँ 1135 थे। श्रेणी लगभग दो सौ दिन से बढ़ रही थी और रिपोर्ट में सबसे बड़ा था।
अंतर मायने रखता है। पहले मामले में खोज इंजन ने सामग्री का आकलन किया और गिरावट आई। दूसरे में यह बिल्कुल पृष्ठ पर कोई समय नहीं बिताया - इसलिए सवाल पाठ नहीं है, लेकिन साइट क्रॉल क्यों नहीं अर्जित की थी।
यही कारण है कि क्रॉल बजट का मतलब क्या है। क्रॉलर समय और अनुरोधों की सीमित अनुमति के साथ आता है। यह सब कुछ आप जमा करने के लिए बाध्य नहीं है, और यह खुद के लिए जहां खर्च करने का फैसला करता है। एक युवा डोमेन पर भत्ता छोटा है और इसे सावधानी से खर्च करना पड़ता है।
तीन स्थानों पर जहां कारण आमतौर पर बैठता है
जब क्रॉलर नहीं आता है, तो जवाब लगभग तीन स्थानों में से एक है।
सबसे पहले, डोमेन के अधिकार के सापेक्ष साइटमैप का आकार। एक सौ इनबाउंड लिंक के साथ एक साइट के लिए दो हजार पते इसके पीछे कुछ भी नहीं है। खोज इंजन मात्रा को देखता है, विश्वास का वजन करता है और एक अंश को क्रॉल करता है।
दूसरा, आंतरिक लिंक। एक पृष्ठ जो साइट लिंक पर कोई अन्य पृष्ठ नहीं है, वह एक क्रॉलर के लिए मुश्किल से मौजूद है। एक साइटमैप एक पता संचारित करता है; यह महत्व का संचार नहीं करता है। संपर्क महत्व
तीसरा, पूरे अनुभाग में गुणवत्ता संकेत। यदि क्रॉलर ने एक सेक्शन के सौ पृष्ठों को कवर किया है और इंडेक्स में कोई नहीं लिया है, तो यह बाकी पर भी अर्थशास्त्र करता है। अनुभाग एक प्रतिष्ठा प्राप्त करता है, और वह प्रतिष्ठा इसके अंदर नए पते तक फैलती है।
हमने सभी तीनों की जाँच की और एक बार में दूसरा और पहला कारण पाया।
साइटमैप का चालीस प्रतिशत एक खंड में चला गया
हमने साईटमैप खोला और इसमें क्या था इसकी गिनती की। 2074 पते थे। उनमें से 900 एक सूची से संबंधित हैं - तीन सौ और तीन भाषाओं में एक आइटम के साथ एक उत्पाद अनुभाग।
खोज के लिए प्रस्तुत सब कुछ का चालीस-तीन प्रतिशत एक ही अनुभाग में चला गया। और उस खंड को मुश्किल से सभी में अनुक्रमित किया जा रहा था।
फिर हमने आंतरिक लिंक की गिनती की। सेक्शन का अपना पेज तीन सौ और एक आइटम के बीस-पाँच से जुड़ा हुआ है। शेष दो सौ और सत्तर-छह केवल ग्यारह पेजों के माध्यम से पहुंच योग्य थे। उन पगिनेशन पेज सभी पर स्थलाप में नहीं थे।
चित्र एक साथ आया। हम क्रॉलर को बताते समय खोज करने के लिए नौ सौ पते जमा करते हैं, साइट की संरचना के माध्यम से, उनमें से बीस-पाँच विषय है। यह वास्तव में पढ़ता है: अगर मालिक उन्हें लिंक करने लायक नहीं मानता है, तो वे शायद महत्वपूर्ण नहीं हैं।
क्यों यह पूरी साइट को धीमा कर देता है, न केवल एक खंड
यहाँ अक्सर याद किया जाता है। क्रॉल बजट पूरे डोमेन में साझा किया जाता है। यह वर्गों के बीच समान रूप से विभाजित नहीं है और यह उन मामलों के लिए आरक्षित नहीं है।
जिसका मतलब है कि कीमतों के साथ सौ सेवा पृष्ठ क्रॉलर के ध्यान के लिए प्रतिस्पर्धा करने के लिए हजार पते जो कभी रैंक नहीं कर रहे थे। और वे हार जाते हैं, क्योंकि बाद में केवल अधिक होते हैं।
यह जुर्माना नहीं है। यह एक सीमित संसाधन का साधारण आवंटन है। लेकिन इसके प्रबंधन के लिए वास्तव में दो लीवर हैं: जो आप साइटमैप में प्रस्तुत करते हैं, और आप साइट के अंदर क्या लिंक करते हैं।
हमने पहले इस्तेमाल किया, क्योंकि यह तुरंत काम करता है, जबकि दूसरे को अनुभाग को फिर से बनाने की आवश्यकता होती है।
हम जिस तरह से करते हैं वह गलती
एक बड़ी साइटमैप के लिए मानक सलाह इसे एक इंडेक्स में विभाजित करना है: एक मुख्य फ़ाइल कई विषयगत लोगों पर इंगित करती है। यह खोज इंजन के लिए क्रॉल आवंटन को आसान बनाता है और प्रति सेक्शन कवरेज आपको दिखाई देता है।
हमने बिल्कुल ऐसा किया। और पूरी तरह से साइटमैप तोड़ दिया।
साइट नेक्स्ट.js पर स्थानीय मार्गों जैसे /ru और /es के साथ चलती है। फिलहाल साइटमैप इंडेक्स मोड में स्विच करता है, मुख्य फ़ाइल अपने स्वयं के हैंडलर द्वारा सेवा की जा रही है और सामान्य मार्ग में गिरती है, जो एक भाषा कोड के रूप में अपना नाम पढ़ती है। परिणाम बहुत फ़ाइल रोबोट पर 404 है।
हमने इसे स्थानीय निर्माण पर जारी होने से पहले पकड़ा। इसे वापस लुढ़काया, इसके पिछले पते की गिनती के साथ फिर से 200 वापस लौट आया। कुछ भी नहीं टूट गया उत्पादन।
पाठ Next.js के बारे में नहीं है: किसी भी साइटमैप परिवर्तन को स्वयं फ़ाइल के अनुरोध के साथ सत्यापित किया जाना चाहिए, न कि कोड को पढ़कर। यह तीस सेकंड की लागत है, और त्रुटि की कीमत पूरी तरह से किसी नोटिस तक साइटमैप का नुकसान है।
हम अंत में क्या बदल सकते हैं
हमने साइटमैप से नौ सौ उत्पाद पृष्ठों को हटा दिया और इसमें सेक्शन पेज रखा। 2074 पते से 1174 तक साइटमैप shrank।
वे वास्तव में जहां थे, खुद ही पृष्ठ रहते हैं। वे खुले हैं, 200 वापस लौटते हैं, लोगों द्वारा और आंतरिक लिंक से पहुंचते हैं और नेविगेशन में भाग लेते हैं। केवल खोज करने के लिए जमा करना बंद हो गया - अनुरोध जो कहता है कि कृपया इसे क्रॉल करें।
एक साइटमैप से हटाने और अनुक्रमण के लिए बंद करने के बीच अंतर मौलिक है, और यह लगातार भ्रमित है। एक noindex टैग खोज इंजन को बताता है: परिणाम में इस पृष्ठ को नहीं दिखाते। साइटमैप से हटाना कुछ और कहता है: मैं अब आपको अभी इस पर क्रॉल खर्च करने के लिए कहता हूं।
दूसरा एक पंक्ति में बदला जा सकता है और कोई निशान नहीं छोड़ता है। जब अनुभाग में उचित आंतरिक लिंक होते हैं, या डोमेन का अधिकार अधिक होता है, तो उत्पाद पृष्ठ साइटमैप में वापस आते हैं।
बाद में क्या उम्मीद की जाए, और क्या नहीं
कोई तत्काल प्रभाव नहीं होगा। एक खोज इंजन फिर से एक से दो सप्ताह में एक साइटमैप पढ़ता है, और खोजी गई श्रेणी धीरे-धीरे सेटिंग के बजाय सिकुड़ती है।
कुछ और अधिक मायने रखता है, और यह स्पष्ट रूप से कह रहा है: एक साइटमैप को सजाने से अधिकार नहीं बनता है। इसे बढ़ाने के बिना यह क्रॉलर के ध्यान को फिर से वितरित करता है। यदि डोमेन में कुछ इनबाउंड लिंक हैं, तो पंद्रह सौ पते धीरे-धीरे अनुक्रमित होंगे - सिर्फ धीरे-धीरे और कुछ उद्देश्य के बजाय धीरे-धीरे और कुछ भी नहीं।
इसलिए इसे स्वच्छता के रूप में इलाज करें, रणनीति नहीं। यह शोर को साफ़ करता है ताकि बाकी ईमानदारी से काम कर सकें। विकास अन्य चीजों से आता है: बाहरी साइटों पर उल्लेख, पृष्ठों पर अद्वितीय पाठ, वास्तविक प्रश्नों जो वास्तव में आपको ढूंढते हैं।
हम क्या कर रहे हैं?
साइटमैप को ट्रिमिंग तीन चरणों में से पहला है, और दूसरा दो लंबे समय तक लेते हैं।
दूसरा उस सूची में आंतरिक लिंक का पुनर्निर्माण कर रहा है। तीन सौ और एक आइटम के लिए ट्वेंटी-पाँच लिंक एक संरचना बन गई है जहां किसी भी उत्पाद को घर पृष्ठ से दो या तीन क्लिक हैं: क्यूरेट समूहिंग, पड़ोसी वस्तुओं के बीच क्रॉस-लिंक, साइटमैप में उपस्थित पेज। यह एक पृष्ठ के नीचे एसईओ पाठ के बारे में नहीं है; यह वास्तव में नेविगेशन लोगों के बारे में है।
तीसरा उत्पाद पृष्ठों को ट्रैंच में साइटमैप में वापस आ रहा है। एक बार में सभी नौ सौ नहीं, लेकिन एक बार में एक सौ या तो, उन लोगों के साथ शुरू जो पहले से ही उन पर इंगित करते हैं। जिस तरह से प्रत्येक ट्रेंच की अनुक्रमण योग्य है, और यदि कोई स्टॉप लिया जाता है, तो आपको पता है कि कहाँ रुकना है।
आदेश जानबूझकर है। लिंक को ठीक किए बिना साइटमैप को भेजे गए पते एक महीने बाद उसी कहानी को दोहराते हैं।
404 के बारे में एक अलग शब्द
रिपोर्ट से पता चलता है कि 673 पता नहीं मिला, सत्यापन के साथ असफल रहा। नंबर 738 अनुक्रमित पृष्ठों के बगल में अलार्मिंग दिखता है।
लेकिन यह एक मंच माइग्रेशन से एक विरासत है। खोज इंजन के वर्षों के लिए सैकड़ों पुराने पते थे, और इंजन के परिवर्तन के बाद वे मौजूदा बंद हो गए।
404 यहाँ सही है। इससे अधिक: पृष्ठों के लिए स्थायी रूप से कोई प्रतिस्थापन के साथ नष्ट कर दिया, 410 बेहतर जवाब है - अच्छा है कि जल्दी कतार से इस तरह के पते साफ़ करने के लिए चला गया का प्रत्यक्ष संकेत है।
क्या करना है: पुराने पते को पुनर्निर्देशित करें घर पृष्ठ पर बड़े पैमाने पर। खोज इंजन यह मानते हैं कि किसी भी तरह से एक नरम त्रुटि और सूचकांक में गिरावट के रूप में, और आप यह देखने की क्षमता खो देते हैं कि कौन से पुराने पृष्ठ अभी भी देख रहे हैं।
अपनी खुद की साइट पर एक ही चीज़ की जांच कैसे करें
पृष्ठ अनुक्रमण रिपोर्ट खोलें और उसके पते की गिनती के साथ हर कारण को लिखें। उन्हें जोड़ें और अपनी साइटमैप में लाइनों की संख्या के साथ कुल की तुलना करें - अकेले विसंगति आपको बताती है कि क्या खोज इंजन उन पृष्ठों के बारे में जानता है जिन्हें आप कभी नहीं जमा करते हैं।
श्रेणी में सबसे तेजी से वृद्धि हुई है। यह दर्शाता है कि साइट किस तरह की है।
गणना क्या आपका साइटमैप अनुभाग द्वारा अनुभाग से बना है। यदि कोई अनुभाग एक तिहाई से अधिक लेता है और इसे अनुक्रमित नहीं किया जा रहा है, तो आपको अपनी बोतलबंदी मिली है।
कितने आंतरिक लिंक उस अनुभाग में इंगित करते हैं। उनमें इंगित करने वाले स्थल मानचित्र और लिंक में पते के बीच दो गुना अंतर पहले से ही एक संकेत है।
और स्पॉट-चेक उनके रोबोट मेटा टैग के लिए साइटमैप से एक दर्जन पते। खोज करने के लिए प्रस्तुत करना जो आपने अनुक्रमण के लिए बंद किया है वह एक आम और महंगी गलती है: यह क्रॉल को जलाता है और साइटमैप में पूरी तरह से नुकसान पहुंचाता है।
कितनी बार जांच करना
एक आखिरी बात, और यह आपको समय बचाता है। दो से तीन दिनों तक कंसोल डेटा लैग खोजें।
हमने रिपोर्ट को तीन दिनों तक जारी किया। दूसरा और तीसरा निर्यात सभी दस पंक्तियों में इकाई से मेल खाता है - लगभग नहीं, बल्कि शाब्दिक रूप से समान आंकड़े।
दैनिक रिपोर्ट पढ़ना व्यर्थ है: आप एक ही स्नैपशॉट देखते हैं और एक प्रवृत्ति डेटा शामिल नहीं है के बारे में निष्कर्ष निकालते हैं। एक बार एक सप्ताह में एक निश्चित के परिणाम के लिए निर्यात अंतराल का दुरुपयोग किए बिना आंदोलन को नोटिस करने के लिए पर्याप्त होता है।
व्यावहारिक चेकलिस्ट
- अपने पते की गिनती के साथ रिपोर्ट में हर कारण को लिखें और उन्हें जोड़ें।
- उस कुल की तुलना अपनी साइटमैप में लाइनों की संख्या के साथ करें।
- पिछले सप्ताह में सबसे तेजी से बढ़ने वाली श्रेणी का पता लगाएं।
- यह पृष्ठ हिंदी में उपलब्ध नहीं है।
- उस खंड में कितने आंतरिक लिंक इंगित करते हैं।
- उनके रोबोट मेटा टैग के लिए एक दर्जन साइटमैप पते की जांच करें।
- साइटमैप को संपादित करने के बाद, फ़ाइल को स्वयं अनुरोध करें और इसकी पुष्टि 200 रुपये है।
सवाल और जवाब
खोजे गए राज्य में कितने समय तक एक पृष्ठ बैठ सकता है?
कोई निश्चित अवधि नहीं है। एक पृष्ठ एक क्रॉल के लिए सप्ताह या महीने का इंतजार कर सकता है, और कभी ऐसा नहीं हो सकता कि साइट इसे कोई आंतरिक लिंक नहीं देता है और कोई अधिकार नहीं प्राप्त करता है। एक बार खोज इंजन के पास उस विशेष पृष्ठ पर एक क्रॉल खर्च करने का कारण होता है।
क्या मैन्युअल रूप से अनुक्रमण सहायता का अनुरोध करता है?
व्यक्तिगत पते के लिए, हाँ। एक प्रणालीगत समस्या के लिए, नहीं। मैनुअल कोटा लगभग दस दिन है, इसलिए यदि एक हजार से अधिक पृष्ठों को बिना अनुक्रमित किया जाता है, तो उनके माध्यम से हाथ से काम करना व्यर्थ है। इसके बजाय कारण को ठीक करें।
क्या बिना अनुक्रमित पृष्ठों को रोबोट.txt में अवरुद्ध किया जाना चाहिए?
नहीं, जिससे यह खराब हो जाता है। रोबोट में अवरुद्ध एक पृष्ठ फिर से क्रॉल नहीं किया जा सकता है, इसलिए खोज इंजन कभी नहीं देखता है कि आपने इसे तय किया है। यदि कोई पृष्ठ खोज में नहीं होना चाहिए, तो एक noindex मेटा टैग का उपयोग करें और इसे उसी समय sitemap से हटा दें।
क्या पृष्ठों की संख्या कैसे बाकी रैंक को प्रभावित करती है?
Indirectly हाँ, क्रॉल बजट के माध्यम से। एक क्रॉलर एक साइट पर सीमित समय बिताता है, और यदि यह उन वर्गों पर जाता है जो रैंक नहीं करते हैं, तो वाणिज्यिक पृष्ठों को कम ध्यान दिया जाता है और बदलाव के बाद फिर से क्रॉलिंग किया जाता है।
स्थायी रूप से हटाए गए पृष्ठों के लिए, 404 या 410 बेहतर है?
पृष्ठों के लिए कोई प्रतिस्थापन के साथ अच्छा के लिए हटा दिया, 410 अधिक सटीक है। यह एक प्रत्यक्ष संकेत है कि पता स्थायी रूप से चला गया है, और सर्च इंजन एक साधारण 404 की तुलना में जल्दी कतार से इस तरह के पते को साफ़ करते हैं।

