একবার একটি ওয়েবসাইট অডিট করতে গিয়ে দেখি, XML Sitemap-এ কয়েক হাজার URL জমা আছে। সাইটের মালিকের ধারণা ছিল, Sitemap যত বড় হবে, Google তত বেশি পেজ খুঁজে পাবে এবং তত বেশি পেজ index হবে।
কিন্তু Search Console খুলে দেখা গেল উল্টো চিত্র। অনেক URL redirect হচ্ছে, কিছু পেজে noindex, বেশ কিছু URL robots.txt দিয়ে বন্ধ, আবার একই পেজের একাধিক parameter-যুক্ত সংস্করণ Sitemap-এ ঢুকে আছে। কিছু URL 404 দেখাচ্ছে। তার ওপর “crawled – currently not indexed” ধরনের অবস্থাও কম নয়।
তখন প্রশ্ন আসে—Sitemap-এ এত URL রাখার পরও লাভ হলো না কেন?
কারণ XML Sitemap-এর কাজ সাইটে যত URL আছে সবকিছুর তালিকা বানানো নয়। বরং এখানে এমন URL রাখা উচিত, যেগুলো আপনি সত্যিই search engine-কে খুঁজে পেতে, crawl করতে এবং সম্ভাব্যভাবে index করতে দিতে চান।
তাই Sitemap-এ কোন URL রাখা উচিত নয়—এই বিষয়টি বোঝা টেকনিক্যাল SEO-এর খুবই গুরুত্বপূর্ণ অংশ।
একটি ভালো Sitemap বড় হওয়া জরুরি নয়। পরিষ্কার হওয়া জরুরি।
XML Sitemap আসলে কী?
XML Sitemap হলো এমন একটি ফাইল, যেখানে একটি ওয়েবসাইটের গুরুত্বপূর্ণ URL-এর তালিকা থাকে। চাইলে প্রতিটি URL-এর সঙ্গে lastmod-এর মতো অতিরিক্ত তথ্যও রাখা যায়, যাতে search engine বুঝতে পারে পেজটি সর্বশেষ কবে উল্লেখযোগ্যভাবে পরিবর্তন হয়েছে।
বড় ওয়েবসাইট, নতুন সাইট, দুর্বল internal linking-যুক্ত সাইট কিংবা নিয়মিত নতুন পেজ প্রকাশ হয়—এমন সাইটে Sitemap বিশেষভাবে কাজে লাগে। কারণ search engine শুধু লিংক ধরে crawl করেই নয়, Sitemap থেকেও নতুন URL সম্পর্কে জানতে পারে।
তবে এখানে একটি বিষয় পরিষ্কার রাখা দরকার।
Sitemap কোনো নির্দেশ নয়।
কোনো URL Sitemap-এ থাকলেই সেটি অবশ্যই crawl হবে বা index হবে—এমন নিশ্চয়তা নেই। Sitemap মূলত search engine-কে URL খুঁজে পেতে সহায়তা করে। শেষ পর্যন্ত কোন URL crawl হবে, কোনটি index হবে বা কোনটি search result-এ দেখানো হবে—সিদ্ধান্ত search engine নিজেই নেয়।
Sitemap protocol-এ changefreq ও priority নামে কিছু পুরোনো ঘর এখনো রয়েছে। তবে বর্তমান সময়ে বড় search engine-গুলো এগুলোকে খুব বেশি গুরুত্ব দেয় বলে সাধারণত ধরা হয় না। তাই এগুলোকে SEO-র বড় কোনো প্রভাবক মনে করা ঠিক হবে না।
বরং সঠিক URL নির্বাচন এবং lastmod-এর মতো তথ্য ঠিকভাবে দেওয়া বেশি গুরুত্বপূর্ণ।
Sitemap-এ কি সব URL দেওয়া ভালো?
না।
সাইটে কোনো URL তৈরি হয়েছে বলেই সেটি Sitemap-এ রাখার দরকার নেই।
একটি পরিষ্কার Sitemap-এর জন্য সাধারণ নিয়মটি হতে পারে:
canonical + indexable + crawlable + মূল্যবান = Sitemap-এ রাখার উপযুক্ত URL
অর্থাৎ URL-টি হওয়া উচিত:
- আপনার পছন্দের canonical URL;
- search engine-এর crawl করার উপযোগী;
- noindex নয়;
- redirect নয়;
- ব্যবহারকারী ও search result-এর জন্য যথেষ্ট মূল্যবান।
ধরা যাক, একটি ই-কমার্স সাইটে বিভিন্ন filter, sort, campaign এবং session parameter মিলিয়ে পাঁচ লাখ URL তৈরি হতে পারে। কিন্তু এর মধ্যে প্রকৃত product, category ও তথ্যবহুল পেজ হয়তো অনেক কম।
Sitemap-এ ওই পাঁচ লাখ URL ঢুকিয়ে দিলেই SEO ভালো হবে না। বরং অপ্রয়োজনীয় URL বাদ দিয়ে গুরুত্বপূর্ণ canonical URL-গুলো রাখাই সঠিক পদ্ধতি।
XML Sitemap-এ কোন ধরনের URL রাখা উচিত নয়

| URL-এর ধরন | কেন বাদ দিতে হবে | উদাহরণ |
| Non-canonical বা duplicate URL | একই বিষয়বস্তুর একাধিক সংস্করণ তৈরি হয় | /product?sort=price |
| robots.txt-এ বন্ধ URL | Sitemap ও crawl নিয়ন্ত্রণ পরস্পরবিরোধী হয় | /private/page/ |
| noindex পেজ | Sitemap গুরুত্ব দেখায়, noindex index বন্ধ করতে বলে | /thank-you/ |
| Redirect হওয়া URL | crawler-কে অন্য URL-এ যেতে হয় | /old-page/ → /new-page/ |
| 4xx বা 5xx URL | কার্যকর পেজ পাওয়া যায় না | /deleted-product/ |
| Login বা private পেজ | search crawler বিষয়বস্তু দেখতে পারে না | /my-account/ |
| কম-মূল্যের বা ফাঁকা পেজ | search result-এর জন্য আলাদা মূল্য নেই | ফাঁকা tag archive |
| Tracking parameter-যুক্ত URL | একই পেজের অপ্রয়োজনীয় সংস্করণ তৈরি হয় | ?utm_source=facebook |
| ভুল domain বা protocol | canonical version-এর সঙ্গে মিল থাকে না | http://example.com/ |
এখন প্রতিটি ধরন একটু বিস্তারিতভাবে দেখা যাক।
Non-canonical ও duplicate URL কেন বাদ দেবেন?
Sitemap পরিষ্কার করার সময় সবচেয়ে বেশি যে সমস্যা ধরা পড়ে, তা হলো একই পেজের একাধিক URL।
ধরা যাক, একটি পণ্যের মূল URL:
https://example.com/shoes/red-running-shoe/
কিন্তু একই পেজ পাওয়া যাচ্ছে:
?sort=price
?ref=homepage
?session=12345
?print=1
যদি সবগুলো URL একই বিষয়বস্তু দেখায় এবং canonical tag মূল URL-এর দিকে নির্দেশ করে, তাহলে Sitemap-এ শুধু মূল canonical URL-টিই থাকা উচিত।
এখানে parameter থাকলেই URL খারাপ—এমন নয়।
কোনো parameter-যুক্ত URL যদি সত্যিই আলাদা search intent পূরণ করে, আলাদা বিষয়বস্তু দেয় এবং নিজেই canonical হয়, তাহলে সেটি রাখা যেতে পারে।
কিন্তু একই বিষয়বস্তুর একাধিক সংস্করণ Sitemap-এ রাখলে তালিকাটি অপ্রয়োজনীয়ভাবে বড় হয় এবং search engine-এর কাছে কোন URL আসল তা বোঝা কঠিন হতে পারে।
robots.txt-এ বন্ধ URL Sitemap-এ রাখা উচিত কি?
সাধারণত না।
কারণ এখানে দুই ধরনের বিপরীত বার্তা তৈরি হয়।
Sitemap বলছে:
“এই URL আমার গুরুত্বপূর্ণ URL-এর তালিকায় আছে।”
অন্যদিকে robots.txt বলছে:
“এই URL crawl করবেন না।”
এই দুই নির্দেশ একসঙ্গে দেওয়ার কোনো অর্থ নেই।
আরেকটি বিষয়ও মনে রাখা জরুরি। robots.txt মূলত crawl নিয়ন্ত্রণ করে, index নয়।
অর্থাৎ কোনো URL robots.txt দিয়ে বন্ধ করলেই সেটি search result থেকে নিশ্চিতভাবে বাদ যাবে—এমন নয়। অন্য কোনো লিংক থেকে search engine URL-টির অস্তিত্ব জানতে পারে।
আর যদি একই URL-এ noindex থাকে কিন্তু robots.txt দিয়ে crawl বন্ধ করা থাকে, crawler সেই noindex নির্দেশটিই পড়তে নাও পারে।
তাই URL-টি যদি ইচ্ছাকৃতভাবে crawl-এর বাইরে থাকে, সেটিকে Sitemap থেকেও বাদ দেওয়া ভালো।
Sitemap-এ noindex পেজ থাকলে কী সমস্যা হয়?
এই ভুলটি খুবই সাধারণ।
ধরা যাক, একটি thank-you page-এ noindex দেওয়া আছে। অর্থাৎ আপনি search engine-কে বলছেন, এই পেজটি search result-এ দেখানোর দরকার নেই।
কিন্তু একই URL যদি Sitemap-এ থাকে, সেখানে আবার সেটিকে গুরুত্বপূর্ণ URL-এর তালিকায় দেখানো হচ্ছে।
এখানে অপ্রয়োজনীয় বিরোধ তৈরি হয়।
noindex ব্যবহার করা যেতে পারে:
- ধন্যবাদ পেজে;
- ফর্ম পূরণের পরের পেজে;
- কিছু প্রচারাভিযান-নির্ভর পেজে;
- ব্যবহারকারীর জন্য দরকারি কিন্তু search-এর জন্য অপ্রয়োজনীয় পেজে।
এই পেজগুলো ওয়েবসাইটে থাকা স্বাভাবিক। কিন্তু XML Sitemap-এ রাখার দরকার নেই।
Redirect হওয়া URL Sitemap-এ রাখবেন না
ধরা যাক:
/seo-guide-2024/
এখন 301 redirect হয়ে যাচ্ছে:
/seo-guide/
এ অবস্থায় Sitemap-এ পুরোনো URL রাখা উচিত নয়। নতুন final URL-টিই রাখা উচিত।
কারণ search crawler পুরোনো URL-এ গিয়ে আগে redirect অনুসরণ করবে, তারপর নতুন URL-এ পৌঁছাবে। Sitemap-এর কাজ যদি গুরুত্বপূর্ণ final URL দেখানো হয়, তাহলে মাঝের redirect URL রেখে লাভ নেই।
Site migration-এর পর এই ভুল খুব বেশি দেখা যায়।
অনেক সময়:
- redirect ঠিক থাকে;
- internal link ঠিক করা হয়;
- canonical বদলানো হয়;
- কিন্তু Sitemap পুরোনো URL-ই দেখাতে থাকে।
ফলে migration শেষ হলেও Sitemap পুরোনো কাঠামোর চিহ্ন বহন করে যায়।
404, 4xx ও 5xx URL কেন বাদ দেবেন?
Sitemap-এর প্রতিটি URL-এ কার্যকর পেজ পাওয়া উচিত।
কোনো URL যদি 404 দেয়, তার মানে পেজটি নেই।
যদি 410 দেয়, তার মানে পেজটি ইচ্ছাকৃতভাবে সরানো হয়েছে।
আবার কোনো URL নিয়মিত 5xx error দেখালে সেখানে server-side সমস্যা রয়েছে।
এই ধরনের URL Sitemap-এ রেখে দেওয়ার কোনো লাভ নেই।
তবে একটি বিষয় মাথায় রাখতে হবে। কোনো পেজ সাময়িকভাবে একবার 500 error দিয়েছে মানেই সঙ্গে সঙ্গে Sitemap থেকে মুছে দিতে হবে—এমন নয়।
কিন্তু যদি বোঝা যায় URL আর কার্যকর নয়, সেটিকে Sitemap থেকে সরানো উচিত।
Soft 404-ও খেয়াল করতে হবে।
অনেক সাইটে পেজটি HTTP 200 দেখায়, কিন্তু ভেতরে লেখা থাকে “কিছু পাওয়া যায়নি”। কারিগরিভাবে 200 হলেও search engine পেজটিকে soft 404 হিসেবে দেখতে পারে।
তাই শুধু status code নয়, পেজের আসল বিষয়বস্তুও মাঝে মাঝে পরীক্ষা করা দরকার।
Login, account ও admin URL বাদ দিন
/login/
/admin/
/my-account/
/orders/
এই ধরনের পেজ সাধারণত search result-এর জন্য তৈরি নয়।
কিছু পেজে login ছাড়া বিষয়বস্তু দেখা যায় না। কিছু পেজ ব্যক্তিগত। কিছু পেজ শুধু সাইট ব্যবস্থাপনার কাজে লাগে।
Search crawler সেখানে গেলে হয়:
- login page দেখবে;
- 401 বা 403 পেতে পারে;
- অথবা অসম্পূর্ণ বিষয়বস্তু পাবে।
এই URL-গুলো Sitemap-এ রাখার দরকার নেই।
XML Sitemap আপনার সাইটের প্রতিটি route বা পেজের হিসাবখাতা নয়। এটি search-এর জন্য গুরুত্বপূর্ণ URL-এর তালিকা।
কম-মূল্যের বা অপ্রয়োজনীয় পেজ
সব 200-status page index করার মতো নয়।
অনেক সাইটে দেখা যায়:
- internal search result page;
- কোনো পোস্ট নেই এমন tag archive;
- ফাঁকা category;
- অপ্রয়োজনীয় filter page;
- খুব কম বিষয়বস্তু-যুক্ত author archive;
- স্বয়ংক্রিয়ভাবে তৈরি পাতলা পেজ।
এগুলো technically ঠিক থাকতে পারে, কিন্তু search result-এর জন্য আলাদা মূল্য নাও দিতে পারে।
এখানে আগে সিদ্ধান্ত নিতে হবে—পেজটি organic search-এর জন্য দরকার কি না।
যদি দরকার না হয়, তাহলে Sitemap-এ রাখারও দরকার নেই।
তবে tag বা category দেখলেই বাদ দিতে হবে—এমন নয়।
একটি ভালো category page যদি ব্যবহারকারীর প্রশ্নের উত্তর দেয়, সঠিক পণ্য বা লেখা সাজিয়ে দেয় এবং যথেষ্ট আলাদা মূল্য দেয়, তাহলে সেটি খুবই গুরুত্বপূর্ণ SEO landing page হতে পারে।
সুতরাং পেজের ধরন নয়, পেজের আসল মূল্য বিবেচনা করতে হবে।
Tracking parameter-যুক্ত URL বাদ দিন
প্রচারাভিযান চালানোর সময় একই landing page-এর নানা URL তৈরি হয়।
যেমন:
?utm_source=facebook
?utm_medium=email
?utm_campaign=eid-sale
এগুলো প্রচারাভিযান পরিমাপের জন্য কাজে লাগে। কিন্তু index করার জন্য সাধারণত দরকার হয় না।
একটি landing page-এর মূল URL যদি হয়:
https://example.com/eid-sale/
তাহলে Sitemap-এ এই clean URL-টিই থাকা উচিত।
utm_-যুক্ত সব campaign URL যোগ করলে একই পেজের অনেক অপ্রয়োজনীয় সংস্করণ তৈরি হয়।
এটি বিশেষ করে তখন ঘটে, যখন Sitemap generator কোনো log, database বা অন্য উৎস থেকে URL তুলে নেয় এবং filter করার ব্যবস্থা থাকে না।
HTTP, HTTPS, www ও non-www মিলিয়ে রাখুন
ধরা যাক, আপনার canonical site version:
https://www.example.com/
কিন্তু Sitemap-এ URL আছে:
http://example.com/
যদি পুরোনো URL redirect হয়ে canonical version-এ যায়, তাহলে Sitemap-এ পুরোনো URL রাখার কোনো কারণ নেই।
Site migration-এর পর এই ভুল প্রায়ই দেখা যায়।
যেমন:
- HTTP থেকে HTTPS করা হয়েছে;
- non-www থেকে www করা হয়েছে;
- domain বদলেছে;
- কিন্তু পুরোনো Sitemap generator এখনো আগের URL তৈরি করছে।
Sitemap-এ সবসময় আপনার নির্বাচিত canonical protocol ও hostname ব্যবহার করা উচিত।
ভুল URL Sitemap-এ থাকলে কী প্রভাব পড়ে?
Sitemap-এ ভুল URL থাকলেই search engine penalty দেবে—এমন কথা বলা ঠিক নয়।
ক্ষতিটা মূলত crawl, indexing এবং site management-এর জায়গায়।
| প্রভাব | ব্যাখ্যা |
| ক্রল বাজেটের অপচয় | crawler গুরুত্বপূর্ণ URL-এর বদলে duplicate, redirect বা dead URL দেখতে সময় ব্যয় করতে পারে |
| পরস্পরবিরোধী সংকেত | Sitemap, canonical, robots.txt ও noindex একে অপরের সঙ্গে না মিললে পরিস্থিতি অস্পষ্ট হয় |
| Indexing report জটিল হয় | অপ্রয়োজনীয় URL বাড়লে আসল সমস্যা আলাদা করা কঠিন হয় |
| গুরুত্বপূর্ণ URL কম স্পষ্ট হয় | দরকারি ও অদরকারি URL একই তালিকায় মিশে যায় |
| Migration যাচাই কঠিন হয় | পুরোনো URL রয়ে গেলে নতুন কাঠামো ঠিকমতো চালু হয়েছে কি না বোঝা কঠিন হয় |
| Sitemap-এর কার্যকারিতা কমে | কোন URL-গুলো সত্যিই গুরুত্বপূর্ণ, সেই বার্তাটি দুর্বল হয়ে যায় |
ক্রল বাজেট নিয়ে কতটা চিন্তা করবেন?
সব সাইটে crawl budget সমান গুরুত্বপূর্ণ নয়।
৩০০ বা ৫০০ পেজের একটি ছোট ব্যবসায়িক ওয়েবসাইটে crawl budget নিয়ে অতিরিক্ত আতঙ্কের দরকার নেই।
কিন্তু বড় ই-কমার্স সাইট, সংবাদমাধ্যম, marketplace বা লাখ লাখ URL-যুক্ত সাইটে বিষয়টি গুরুত্বপূর্ণ হয়ে ওঠে।
বিশেষ করে যদি site architecture থেকে অসংখ্য filter, parameter ও duplicate URL তৈরি হয়, তখন crawler কোথায় সময় দিচ্ছে তা গুরুত্বপূর্ণ।
এ অবস্থায় Sitemap-এ অপ্রয়োজনীয় URL ঢুকিয়ে দিলে search engine-এর সামনে দরকারি পেজগুলোর তালিকা পরিষ্কার থাকে না।
তাই Sitemap পরিষ্কার করাকে ranking trick হিসেবে না দেখে crawl ও indexing ব্যবস্থাপনার অংশ হিসেবে দেখা ভালো।
Sitemap কীভাবে পরিষ্কার রাখবেন?
একবার Sitemap বানিয়ে রেখে বছরজুড়ে আর না দেখা ভালো পদ্ধতি নয়।
ওয়েবসাইট বদলালে Sitemap-ও বদলানো উচিত।
নতুন লেখা প্রকাশ হলো, পণ্য মুছে গেল, পুরোনো URL redirect হলো, কোনো পেজে noindex দেওয়া হলো—এসব পরিবর্তন Sitemap-এও প্রতিফলিত হওয়া দরকার।
সবচেয়ে ভালো ব্যবস্থা হলো Sitemap স্বয়ংক্রিয়ভাবে তৈরি হওয়া এবং বর্তমান সাইটের অবস্থার সঙ্গে মিল রাখা।
Sitemap তৈরির নিয়মেই বাদ দেওয়ার ব্যবস্থা রাখুন
Sitemap তৈরি হওয়ার পর হাতে হাজার URL মুছতে বসার চেয়ে শুরুতেই নিয়ম ঠিক করা ভালো।
যেমন Sitemap generator শুধু এমন URL নেবে, যেগুলো:
- 200 response দেয়;
- indexable;
- self-canonical;
- robots.txt-এ বন্ধ নয়;
- redirect নয়;
- private নয়;
- tracking বা session parameter নয়;
- search-এর জন্য সত্যিই দরকারি।
এভাবে Sitemap সাইটের কাঁচা URL তালিকা না হয়ে একটি পরিষ্কার indexable URL তালিকায় পরিণত হয়।
lastmod সঠিকভাবে ব্যবহার করুন
প্রতিবার Sitemap তৈরি হলেই সব URL-এর lastmod আজকের তারিখ দিয়ে দেওয়া ভালো অভ্যাস নয়।
lastmod-এ পেজের বাস্তব ও উল্লেখযোগ্য পরিবর্তনের তারিখ থাকা উচিত।
শুধু footer-এর সাল বদলেছে বা ছোটখাটো কোনো পরিবর্তন হয়েছে—এমন কারণে সব URL নতুন দেখানো ঠিক নয়।
যদি lastmod ব্যবহার করেন, সেটি যেন বাস্তব পরিবর্তনের সঙ্গে মেলে।
Sitemap Audit করার সময় যা যাচাই করবেন
শুধু XML file খুলে URL দেখা যথেষ্ট নয়। URL-গুলোর বাস্তব অবস্থাও পরীক্ষা করতে হবে।
| যাচাইয়ের বিষয় | কীভাবে ধরবেন |
| HTTP status | URL crawl করে 200, 3xx, 4xx ও 5xx আলাদা করুন |
| Canonical | Sitemap URL নিজেকেই canonical করছে কি না দেখুন |
| noindex | HTML robots meta বা X-Robots-Tag পরীক্ষা করুন |
| robots.txt | URL-এর path crawl-এর জন্য বন্ধ কি না দেখুন |
| Parameter | tracking, session, sort ও filter pattern খুঁজুন |
| Protocol/hostname | HTTP/HTTPS ও www/non-www মিলিয়ে দেখুন |
| কম-মূল্যের পেজ | ফাঁকা archive, search page বা পাতলা পেজ আলাদা করুন |
| Indexing | Sitemap URL-এর সঙ্গে crawl/index report মিলিয়ে দেখুন |
| পুরোনো URL | migration-এর আগের path এখনো আছে কি না খুঁজুন |
| lastmod | বাস্তব পরিবর্তনের সঙ্গে তারিখ মেলে কি না যাচাই করুন |
ছোট সাইটে এই কাজ spreadsheet দিয়েও করা যায়। বড় সাইটে crawler বা server-side তথ্য ব্যবহার করা সুবিধাজনক।
কোন সরঞ্জাম ব্যবহার করছেন, সেটি সবচেয়ে গুরুত্বপূর্ণ নয়।
গুরুত্বপূর্ণ হলো—Sitemap যে URL দেখাচ্ছে, সাইটের বাস্তব অবস্থাও কি সেটির সঙ্গে মিলছে?
XML Sitemap-এর সাধারণ Technical সীমা
| বিষয় | সীমা/নিয়ম |
| প্রতি Sitemap file-এ URL | সর্বোচ্চ ৫০,০০০ |
| Sitemap file size | সর্বোচ্চ ৫০MB, uncompressed |
| বড় সাইট | একাধিক Sitemap file ব্যবহার করতে হবে |
| একাধিক Sitemap | Sitemap index file ব্যবহার করা যায় |
| Encoding | XML Sitemap UTF-8 encoded হওয়া উচিত |
| URL format | পূর্ণ absolute URL ব্যবহার করা উচিত |
একটি Sitemap file-এ সর্বোচ্চ ৫০,০০০ URL রাখা যায় এবং uncompressed file size ৫০MB-এর বেশি হওয়া যায় না।
এর বেশি URL থাকলে Sitemap ভাগ করতে হবে।
যেমন:
product-sitemap-1.xml
product-sitemap-2.xml
category-sitemap.xml
article-sitemap-1.xml
এরপর এসব আলাদা Sitemap-কে একটি sitemap-index.xml file থেকে দেখানো যায়।
বড় publisher বা e-commerce সাইটে এটি খুবই স্বাভাবিক ব্যবস্থা।
Sitemap নিয়ে যে ভুলগুলো বারবার দেখা যায়
সবচেয়ে পরিচিত ভুল হলো SEO plugin বা CMS-এর default Sitemap চালু করে আর কখনো তা না দেখা।
Plugin নিজে সমস্যা নয়।
সমস্যা হয় যখন plugin-এর default নিয়ম আপনার site structure-এর সঙ্গে মেলে না।
ধরা যাক, plugin স্বয়ংক্রিয়ভাবে নিচের সবকিছু Sitemap-এ রাখছে:
- tag archive;
- author archive;
- attachment page;
- custom post type;
- অপ্রয়োজনীয় taxonomy।
কিন্তু আপনার SEO পরিকল্পনায় এগুলোর অনেকগুলোকেই index করানোর দরকার নেই।
এক্ষেত্রে default সেটিং রেখে দেওয়া ঠিক নয়।
আরেকটি ভুল হলো URL-এর সংখ্যা বাড়াকে SEO উন্নতি মনে করা।
আগে Sitemap-এ ৮,০০০ URL ছিল, এখন ২৪,০০০—এতে নিজে কোনো অর্জন নেই।
বরং প্রশ্ন হওয়া উচিত, নতুন ১৬,০০০ URL কী ধরনের?
যদি সেগুলো filter, redirect, duplicate বা thin page হয়, তাহলে Sitemap বড় হয়েছে ঠিকই, ভালো হয়নি।
Site restructuring-এর পর Sitemap না দেখা আরেকটি বড় ভুল।
অনেক সময়:
- পুরোনো URL redirect করা হয়েছে;
- নতুন URL তৈরি হয়েছে;
- internal link আপডেট হয়েছে;
- কিন্তু Sitemap এখনো পুরোনো path ধরে রেখেছে।
এই ভুল মাসের পর মাস থেকে যেতে পারে।
Sitemap-এ ভুল URL আছে কি না দ্রুত ধরবেন যেভাবে
একটি কার্যকর audit শুরু করতে Sitemap-এর URL তালিকা এবং site crawl report পাশাপাশি রাখুন।
প্রথমে দেখুন:
কত URL সরাসরি 200 response দেয়।
তারপর 200 URL-এর মধ্যে কতগুলো self-canonical।
এরপর দেখুন:
- কত URL-এ noindex;
- কত URL robots.txt-এ বন্ধ;
- কত URL redirect;
- tracking বা session parameter আছে কি না;
- HTTP/HTTPS mismatch আছে কি না;
- পুরোনো URL রয়ে গেছে কি না।
এরপর Search Console-এর crawl ও indexing তথ্যের সঙ্গে মিলিয়ে দেখুন।
যদি Sitemap-এ বড় সংখ্যায় duplicate, blocked, redirected বা intentionally noindexed URL থাকে, তাহলে প্রথমে Sitemap generation logic ঠিক করাই ভালো।
এখানে লক্ষ্য এমন নয় যে Sitemap-এ থাকা প্রতিটি URL অবশ্যই index হতে হবে।
ভালো, canonical ও indexable পেজও সবসময় index হবে না। Search engine বিষয়বস্তুর মান, মিল, প্রয়োজন, duplication এবং নিজস্ব অগ্রাধিকারের ভিত্তিতে সিদ্ধান্ত নিতে পারে।
Sitemap পরিষ্কার করার মানে indexing-এর নিশ্চয়তা দেওয়া নয়।
বরং আপনার পক্ষ থেকে search engine-কে পরিষ্কার ও সামঞ্জস্যপূর্ণ তথ্য দেওয়া।
Sitemap বড় নয়, পরিষ্কার হওয়াই আসল
শুরুর সেই কয়েক হাজার URL-এর Sitemap-এর কথায় ফিরে আসি।
সমস্যার সমাধান আরও URL যোগ করা নয়।
বরং আগে দেখতে হবে Sitemap-এ এমন কিছু আছে কি না, যা সেখানে থাকারই কথা নয়।
Duplicate URL, tracking parameter, redirect, 404, robots.txt-এ বন্ধ URL, noindex পেজ, private page এবং ভুল canonical version সরিয়ে দিন।
তারপর Sitemap-এ রাখুন শুধু সেই URL-গুলো, যেগুলো সত্যিই canonical, crawlable, indexable এবং search-এর জন্য মূল্যবান।
Sitemap-এ কোন URL রাখা উচিত নয়—এই সিদ্ধান্ত পরিষ্কার করতে পারলে XML Sitemap আর সাইটের সব URL-এর এলোমেলো তালিকা থাকে না।
এটি তখন টেকনিক্যাল SEO-এর একটি পরিষ্কার মানচিত্র হয়ে ওঠে—যেখানে search engine সহজেই বুঝতে পারে, আপনার সাইটে কোন পেজগুলো সত্যিই গুরুত্বপূর্ণ।
সাধারণ জিজ্ঞাসা
Sitemap-এ noindex পেজ থাকলে কী সমস্যা হয়?
noindex দিয়ে আপনি search engine-কে বলছেন পেজটি search result-এ না দেখাতে। আবার Sitemap-এ রাখলে সেটিকে গুরুত্বপূর্ণ URL-এর তালিকায় দেখানো হয়। তাই ইচ্ছাকৃতভাবে noindex করা পেজ Sitemap থেকে বাদ রাখাই ভালো।
Sitemap কতবার আপডেট করা উচিত?
নির্দিষ্ট কোনো সময়সীমা সবার জন্য প্রযোজ্য নয়। সাইটে নতুন URL তৈরি, পেজ মুছে ফেলা, redirect বা indexing নির্দেশ বদলালে Sitemap-ও আপডেট হওয়া উচিত। স্বয়ংক্রিয়ভাবে হালনাগাদ হওয়া Sitemap সবচেয়ে সুবিধাজনক।
Redirect URL কি Sitemap-এ রাখা যায়?
রাখা technically সম্ভব, কিন্তু রাখা উচিত নয়। Sitemap-এ redirect source URL-এর বদলে final canonical URL রাখা ভালো।
Sitemap থেকে URL সরালে কি সেটি Google থেকে মুছে যাবে?
না। Sitemap থেকে URL বাদ দেওয়া deindex করার নির্দেশ নয়। URL অন্য লিংক থেকে পাওয়া গেলে এবং indexable থাকলে search engine সেটিকে index-এ রাখতে পারে। কোনো পেজ search result থেকে সরাতে চাইলে উপযুক্ত noindex বা অন্য সঠিক ব্যবস্থা ব্যবহার করতে হবে।


