Nixeny Dijital - Mersin / AI Readiness 2026
جُلب ملف robots.txt لـ 3,395 موقعًا مؤسسيًا في مرسين، وفُحصت 3,382 صفحة رئيسية من حيث قابليتها للقراءة الآلية. نسبة المواقع التي يستطيع مساعدٌ أن يجيب منها مباشرةً عن سؤال «أين هذه الشركة، ومتى تفتح، وما رقمها» هي 4.5%. سؤال واحد: ماذا تحكي شركات مرسين للآلة؟
ما الذي تقيسه هذه الأرقام وما الذي لا تقيسه
لم يُطرح في هذه الدراسة سؤال واحد على أي نموذج ذكاء اصطناعي. ولم يُقَس أي شركة يستشهد بها المساعدون فعلًا. المُقاس وحده هو هل تتوفر الشروط التي يحتاجها مساعدٌ ليولّد إجابة من هذا الموقع. وعبارة «الذكاء الاصطناعي لا يجد هذه الشركة» لا تُستخرج من هذه البيانات.
حجب زواحف الذكاء الاصطناعي قرار مشروع، ويُحسب في هذا التقرير قرارًا لا خطأً. والمواقع الـ 3,021 التي «لم تكتب أي قاعدة» والمواقع الـ 331 التي «تحجب عن قصد» لا تُدمج في أي جدول: الأولى لم تناقش الأمر قط، والثانية ناقشته وقررت.
أُجريت قياسات المحتوى والبيانات المنظَّمة على الصفحة الرئيسية وحدها. ولا تُرى المخططات ولا قوائم الخدمات ولا الأسئلة الشائعة في الصفحات الداخلية. وهذا يعني أن كل نسب المخطط والمحتوى هنا حدّ أدنى: قد تكون النسبة الحقيقية أعلى، لا أدنى.
أسماء الروبوتات وسياساتها تتغير خلال أشهر؛ وروبوت غير موجود اليوم قد يتصدر القائمة العام المقبل. والنسب هنا لا معنى لها إلا مع قائمة الـ 19 روبوتًا التي بجانبها، ولا يمكن نقلها إلى تاريخ آخر.
المسرد · كل مصطلح مشروح مرة واحدة
- ظهور الذكاء الاصطناعي
- موضوع هذا التقرير: كم من الشروط التي يحتاجها مساعد ذكاء اصطناعي ليولّد إجابة من موقع شركة قد تحقق. ليس حكمًا على الجودة بل مقياسًا لقابلية القراءة.
- الأساس
- يستخدم هذا التقرير ثلاثة أسس رئيسية: 3,395 موقعًا جُلب منه robots.txt، و3,382 موقعًا صفحته الرئيسية قابلة للقراءة، و4,167 نطاقًا مفحوصًا. وداخل الأقسام أسس أضيق (مُنتِجو llms.txt يُحسبون على 352 ملفًا). وإلى جانب كل نسبة مكتوب أيها المقصود.
- robots.txt
- ملف نصي في جذر الموقع يقول أي روبوت يدخل أين. وهو طوعي لا مُلزِم: الروبوتات تختار الالتزام به. وفي هذه الدراسة قُيّم لكل روبوت المسار الجذر ("/") فقط.
- روبوت التدريب / روبوت البحث
- روبوت التدريب (GPTBot، ClaudeBot، Google-Extended) يجمع المحتوى لتدريب النموذج. وروبوت البحث (OAI-SearchBot، PerplexityBot) يجد المصدر ويستشهد به حين يُطرح سؤال. وحجب الاثنين بالقاعدة نفسها يغلق أيضًا احتمال أن يُستشهد بك.
- غياب القاعدة ≠ الحجب
- إن لم يكن في robots.txt قاعدة لروبوت ما، فالسلوك الافتراضي هو السماح بالوصول. ولهذا لا تُوضع المواقع التي «لم تكتب أي قاعدة» والمواقع التي «حجبت عن قصد» في السلة نفسها في أي موضع من هذا التقرير.
- البيانات المنظَّمة (JSON-LD)
- معلومات مضمَّنة داخل الصفحة بصيغة تقرؤها الآلة مباشرة: الاسم والعنوان والهاتف وساعات العمل. غير مرئية للإنسان. وفي هذه الدراسة قُرئ JSON-LD وحده؛ أما microdata وRDFa فخارج النطاق.
- مخطط LocalBusiness
- نوع البيانات المنظَّمة الذي يقول «هذه شركة محلية». وهو الطريقة القياسية لأن يعرّف موقع نفسه للآلة بوصفه شركة؛ وبدونه يضطر المساعد إلى تخمين ماهية الصفحة من النص.
- ثلاثي الاسم-العنوان-الهاتف
- وجود اسم الشركة وعنوانها الصريح وهاتفها ثلاثتها معًا في البيانات المنظَّمة. وإن نقص أحدها فإما ألّا يعطي المساعد الإجابة وإما أن يأخذها من مصدر آخر — من دليل في الغالب.
- llms.txt
- ملف مقترح لتلخيص محتوى الموقع لمساعدات الذكاء الاصطناعي. وهو حتى الآن اقتراح مسوَّدة لا معيار. ولهذا يُبلَّغ عن غيابه بوصفه مقياس تبنٍّ لا نقصًا.
- القابلية للإجابة
- تحقق الشروط الأربعة كلها التي يحتاجها مساعد ليجيب من الموقع مباشرةً عن «أين هذه الشركة، ومتى تفتح، وما رقمها»: البحث غير محجوب، وثلاثي الاسم-العنوان-الهاتف كامل، وساعات العمل موجودة، والمحتوى ظاهر دون تشغيل JavaScript.
- الاعتماد على JavaScript
- أن يقل نص HTML الساكن عن 120 كلمة بينما تُظهر الصفحة التي يعرضها المتصفح أكثر من 2.5 ضعف ذلك. الصفحات الرئيسية لهذه المواقع تبدو فارغة لمتصفح لا يشغّل JavaScript.
- درجة الظهور
- خلاصة موزونة من 0 إلى 100 لستة مكوّنات: إذن الوصول (25)، والبيانات المنظَّمة (25)، وعمق المحتوى (20)، والأساس التقني (15)، وجاهزية الإجابة (10)، وllms.txt (5). ويسقط المكوّن غير القابل للقياس من البسط والمقام؛ وتحت تغطية 60 % لا تُنشر درجة.
أربعة مواقع من كل مئة تستطيع الإجابة عن سؤال
لكي يجيب مساعد ذكاء اصطناعي عن أبسط سؤال عن شركة — أين هي، ومتى تفتح، وما رقمها — مباشرةً من موقع تلك الشركة، تلزم أربعة أشياء: ألّا يحجب robots.txt البحث، وأن يكون ثلاثي الاسم-العنوان-الهاتف كاملًا في البيانات المنظَّمة، وأن تكون ساعات العمل هناك، وأن يظهر المحتوى دون تشغيل JavaScript.
عدد المواقع التي تحقق الأربعة معًا 152 — 4.5%. وتمثل هذه المواقع 170 شركة. أما البقية فإما أن يصمت المساعد وإما أن يأخذ الإجابة من مكان آخر، من دليل في الغالب.
كل عمود هو عدد المواقع التي لا تحقق ذلك الشرط وحده. وقد يتعثر موقع في ثلاثة شروط في آنٍ واحد، ولذلك لا تُجمع الأسطر ولا تُقرأ بوصفها تقسيمًا؛ والترتيب بحسب تكرار عضّ الشرط.
89.0 % من المواقع لم تكتب للذكاء الاصطناعي قاعدة واحدة
robots.txt هو الملف الذي يقول فيه الموقع أي روبوت يدخل أين. لدى 2,227 موقعًا (65.6%) ملف كهذا؛ لكن عدد المواقع التي تحمل بداخله ولو قاعدة واحدة لزواحف الذكاء الاصطناعي هو 374 فقط. أما المواقع الـ 3,021 الباقية فلم يُفتح الموضوع فيها بعد.
ألّا تضع قاعدة ليس حجبًا: إن لم يكن في robots.txt حكم لروبوت ما، فالسلوك الافتراضي هو السماح بالوصول. ولهذا لا يُدمج هذان السطران في أي موضع من التقرير. أحدهما لم يناقش الموضوع قط، والآخر ناقشه وقرر.
سبع قراءات، من الملف نفسه وعلى الأساس نفسه. سطر «مُعرَّفة قاعدة واحدة على الأقل» هو مجموع قرارات الإذن والمنع؛ والسطران تحته يقسمان ذلك المجموع. وسطر Googlebot هو مجموعة الضبط.
يمكن رؤية حال المواقع في تقسيم واحد. السلال الأربع أدناه تغطي المواقع الـ 3,395 كلها ومجموعها يعطي الأساس — لكن سلة «مغلق» ليست أسفل ترتيب، بل خارج الثلاث الأخرى. الموقع هناك أجاب عن السؤال؛ أما الموقع في سلة «غير مرئي» فلم يلتقِ السؤال قط.
كل مربع من المربعات المئة يمثل نحو 34 موقعًا. والسلال يستبعد بعضها بعضًا ومجموعها يساوي الأساس.
زواحف الذكاء الاصطناعي تُحجب 25 ضعف حجب محركات البحث
السبيل الوحيد لمعرفة ما إذا كان الحجب انغلاقًا عامًا أم تمييزًا خاصًا بالذكاء الاصطناعي هو النظر إلى ما تفعله المواقع نفسها بروبوتات البحث الكلاسيكية. 331 موقعًا يحجب في المسار الجذر روبوت ذكاء اصطناعي واحدًا على الأقل؛ وعدد المواقع التي تحجب Googlebot وBingbot هو 13. والفارق بينهما 25.5 ضعفًا.
أي أن المرفوض ليس الزحف، بل استخدام معيّن لما يُزحف عليه. والمواقع نفسها تُدخل محركات البحث.
أربع مجموعات، أساس واحد. ومجموعة الضبط هي روبوتات البحث الكلاسيكية: Googlebot وBingbot. وعمود «مذكور» يعدّ الحالات التي يكتب فيها الموقع اسم تلك المجموعة في robots.txt — والذِّكر ليس حجبًا، فقد يُذكر الروبوت للإذن له أيضًا.
وبالنظر روبوتًا روبوتًا يتبين أن الحجب عمل قوائم: نسب حجب روبوتات التدريب متقاربة جدًا، لأن المواقع نفسها تعدّها في كتلة واحدة. وفي بضعة أسطر يفوق عدد الحاجبين عدد الذاكرين — فالقاعدة هناك تكتبها مجموعة البدل (*)، ولا يرد اسم الروبوت نفسه في الملف إطلاقًا.
كل سطر رمز user-agent. واللون يبيّن عمل الروبوت: الأحمر تدريب، والأزرق الداكن بحث، والأزرق الفاتح جلب بطلب المستخدم، والرمادي بحث كلاسيكي (ضبط).
| الروبوت | عمله | مذكور | حاجب | النسبة |
|---|---|---|---|---|
| GPTBot (OpenAI، تدريب) | تدريب | 346 | 312 | 9.2% |
| OAI-SearchBot (بحث ChatGPT) | بحث | 62 | 40 | 1.2% |
| ChatGPT-User (بطلب المستخدم) | طلب المستخدم | 160 | 135 | 4.0% |
| ClaudeBot (Anthropic، تدريب) | تدريب | 336 | 308 | 9.1% |
| Claude-User (بطلب المستخدم) | طلب المستخدم | 40 | 40 | 1.2% |
| Claude-SearchBot (بحث Claude) | بحث | 43 | 41 | 1.2% |
| PerplexityBot (فهرس بحث) | بحث | 171 | 131 | 3.9% |
| Perplexity-User (بطلب المستخدم) | طلب المستخدم | 32 | 38 | 1.1% |
| Google-Extended (تدريب Gemini) | تدريب | 334 | 305 | 9.0% |
| Applebot-Extended (Apple Intelligence) | تدريب | 316 | 305 | 9.0% |
| meta-externalagent (Meta AI) | تدريب | 214 | 218 | 6.4% |
| Bytespider (ByteDance) | تدريب | 309 | 313 | 9.2% |
| CCBot (Common Crawl) | تدريب | 320 | 318 | 9.4% |
| Amazonbot | تدريب | 303 | 308 | 9.1% |
| cohere-ai | تدريب | 44 | 45 | 1.3% |
| YouBot (You.com) | بحث | 127 | 131 | 3.9% |
| Diffbot | تدريب | 125 | 136 | 4.0% |
| Googlebot (بحث كلاسيكي) | بحث كلاسيكي | 68 | 11 | 0.3% |
| Bingbot (بحث كلاسيكي + Copilot) | بحث كلاسيكي | 40 | 13 | 0.4% |
352 موقعًا لديه llms.txt، ونصفها كتبته إضافة برمجية
llms.txt ملف مقترح لتلخيص محتوى الموقع لمساعدات الذكاء الاصطناعي. وهو ليس معيارًا بعد بل اقتراح مسوَّدة — ولهذا يُقرأ غيابه مقياسَ تبنٍّ لا نقصًا. يوجد لدى 352 موقعًا (10.4%)؛ أما llms-full.txt الأكثر تفصيلًا فلدى 30 موقعًا فقط.
البُغية الحقيقية ليست الرقم نفسه بل من كتبه. 183 من هذه الملفات الـ 352 (52.0%) أنتجتها تلقائيًا إضافة برمجية أو منصة. أي أن هذا الرقم لا يقيس قرار الشركات بشأن الذكاء الاصطناعي، بل ملاحظات إصدار الأداة التي تستخدمها.
أساسان مختلفان، أحدهما فوق الآخر. والنسب في الكتلة السفلى توزيع للملفات الموجودة لا لمجموع المواقع: فإن قُرئت على 3,395 خرج كل سطر خاطئًا برتبة مقدار.
المواقع التي تستطيع الآلة قراءة ساعات عملها: 5.7 بالمئة
البيانات المنظَّمة هي المعلومات المضمَّنة داخل الصفحة والتي لا تراها إلا الآلة: الاسم والعنوان والهاتف وساعات العمل. نسبة المواقع التي تحمل في صفحتها الرئيسية أي كتلة JSON-LD هي 33.9%. لكن العدد ينخفض عند كل خطوة نزولًا من هناك: 10.7% تعرّف نفسها بوصفها شركة، و13.5% لديها ثلاثي الاسم-العنوان-الهاتف كاملًا، و5.7% تعطي ساعات العمل.
هذا الانخفاض هو موضوع التقرير. الحقل الوحيد الذي يحتاجه مساعد ليجيب عن «هل هي مفتوحة الآن» موجود في موقع واحد من كل عشرين.
تسلسل يضيق: أي JSON-LD أولًا، ثم أنواع الشركات، ثم المعلومات الثلاث التي يحتاجها المساعد فعلًا للإجابة عن السؤال.
نسبة اكتمال محسوبة على ثمانية حقول. الوسيط صفر: أكثر من نصف المواقع لا يحمل حقلًا واحدًا يمكن عدّه، ولذلك يُعطى التوزّع نفسه بدل متوسط.
الأنواع التي يستطيع المساعد الاستشهاد بها مباشرة. FAQPage وQuestion تحملان إجابة جاهزة لسؤال؛ وOffer وService وProduct تقول ما هي الخدمة وبكم.
الصفحات الرئيسية لـ 155 موقعًا تبدو للزاحف فارغة
إن غابت البيانات المنظَّمة بقي النص نفسه. تحمل الصفحة الرئيسية الوسيطة 382 كلمة؛ وربعها دون 176. ولدى معظم المواقع ما يُقرأ: 81.7% من المواقع في سلة «كافٍ» أو «غني».
المشكلة عند الطرفين. محتوى 155 موقعًا لا يأتي إلا عند تشغيل JavaScript — أي أن زاحف ذكاء اصطناعي لا يشغّل JavaScript يرى تلك الصفحة الرئيسية فارغة. وفوق ذلك، تحمل الصفحات الرئيسية لـ 150 موقعًا نصًا دون 120 كلمة.
أربع سلال بحسب عدد كلمات النص الساكن في الصفحة الرئيسية. والسلال يستبعد بعضها بعضًا ومجموعها يساوي الأساس.
الإشارات الست التي يبحث عنها المساعد في النص حين تغيب البيانات المنظَّمة. ورابط الهاتف (tel:) مقروء آليًا دون أي مخطط؛ وهو السطر الوحيد فوق النصف.
هذان السطران ليسا المواقع نفسها ولا يُجمعان: الأول يعدّ المواقع التي تحمّل نصها لاحقًا، والثاني تلك التي لا نص في صفحتها الرئيسية إطلاقًا. والنتيجة واحدة في الحالتين: الروبوت الذي لا يشغّل الصفحة كمتصفح لا يجد هناك ما يُقرأ.
الموقع الوسيط يحصل على صفر في اثنين من ستة مكوّنات
ستة مكوّنات تعطي درجة موزونة من 0 إلى 100: إذن الوصول (25)، والبيانات المنظَّمة (25)، وعمق المحتوى (20)، والأساس التقني (15)، وجاهزية الإجابة (10)، وllms.txt (5). الوسيط 53.8، والربيعان بين 44.5 و63.7.
الدرجة ليست حكمًا على الجودة بل مقياسًا للظهور: الدرجة المنخفضة لا تعني شركة سيئة، بل تعني أن ما تستطيع الآلة قراءته أقل. وبالنظر إلى المكوّنات يتبين من أين يأتي التوزّع — الموقع الوسيط ينال الدرجة الكاملة في إذن الوصول وصفرًا في مكوّنين.
خمس سلال مجموعها يساوي الأساس. والتوزّع يتجمع في الوسط: نصف المواقع في نطاق 40-59.
كل مربع من المربعات المئة يمثل نحو 34 موقعًا.
وزن المكوّن مكتوب بجانبه. ووسيط مكوّنين صفر: وهذا ليس فجوة في البيانات بل البُغية نفسها — أكثر من نصف المواقع لا تملك بيانات منظَّمة ولا llms.txt.
الحاسم ليس القطاع بل المنصة المستخدمة
الفارق بين القطاعات ضيق. وسائط 30 قطاعًا محشورة بين 33.8 و64.4، ووسيطها 52.9. أما الفارق بين المنصات فأكبر: 68.9 في Wix، و48.8 في التطوير الخاص.
وأوضح ما يبين ذلك سطر مخطط LocalBusiness: 53.7% من مواقع Wix تعرّف نفسها للآلة بوصفها شركة، مقابل 8.9% من مواقع التطوير الخاص. والفرق بين موقع محامٍ وموقع مركز صيانة سيارات لا تصنعه المحاماة ولا صيانة السيارات، بل الأداة التي بُني بها الموقعان.
الأساسان في السطر الواحد ليسا نفسه، ولا ينبغي أن يكونا: الدرجة الوسيطة تُحسب على كل المواقع المفحوصة، ونسبة LocalBusiness على تلك التي أمكن قراءة صفحتها الرئيسية.
| المنصة | مواقع | الدرجة الوسيطة | LocalBusiness | اسم-عنوان-هاتف | قابل للإجابة |
|---|---|---|---|---|---|
| Wix | 121 | 68.9 | 53.7% | 43.8% | 1.7% |
| Ticimaxمقارنة | 48 | 66.9 | 4.2% | 81.3% | 4.2% |
| Next.js | 146 | 61.4 | 39.0% | 39.0% | 19.2% |
| WordPress | 559 | 59.4 | 7.7% | 8.8% | 3.8% |
| WooCommerce | 386 | 58.8 | 5.2% | 5.7% | 2.3% |
| IdeaSoftمقارنة | 37 | 56.3 | 0.0% | 5.4% | 0.0% |
| تطوير خاص | 1,912 | 48.8 | 8.9% | 11.2% | 4.6% |
كل شرطة هي الدرجة الوسيطة لقطاع. وارتفاع الشرطة لا يحمل معلومة؛ فهو يتبدل في دورة ثلاثية فقط ليبقى المتجاوران قابلين للعدّ. والخط الأحمر هو وسيط وسائط القطاعات.
بُغية هذا الشكل استواؤه. ففي بقية قياسات السلسلة يبلغ الفارق بين الأقضية أضعافًا، أما ظهور الذكاء الاصطناعي فلا يتحرك مع الجغرافيا.
هذه الدراسة لم تسأل أي ذكاء اصطناعي شيئًا
كل أرقام هذا التقرير تقيس جاهزية: كم من الأشياء التي يحتاجها مساعدٌ ليولّد إجابة من هذا الموقع موجود في مكانه. ولا يقيس أي منها ما يفعله المساعد فعلًا.
لم يُطرح في هذه الدراسة سؤال واحد على أي نموذج. عبارة «ساعات العمل ليست في البيانات المنظَّمة» صحيحة وقابلة للتحقق؛ أما عبارة «الذكاء الاصطناعي لا يجد هذه الشركة» فلا تنتج عن هذه البيانات. فالمساعدون يولّدون إجابات أيضًا من الأدلة ومن خدمات الخرائط ومن مصادر لم تنظر إليها هذه الدراسة إطلاقًا. وتلك مسافة لم يقصد هذا التقرير سدّها.
وبالمثل فإن حجب 331 موقعًا لزواحف الذكاء الاصطناعي ليس عيبًا. فقد لا ترغب شركة في استخدام محتواها في تدريب النماذج، وهذه بالضبط طريقة قول ذلك. وهذا التقرير يعدّ ذلك القرار ولا يقيّمه.
- أن مواقع الشركات المحلية ليست مهيأة للإجابة على مساعدات الذكاء الاصطناعي — نسبة المواقع التي تحقق الشروط الأربعة كلها 4.5 %.
- أن موضوع زواحف الذكاء الاصطناعي لم يدخل بعد جدول أعمال الشركات المحلية: 89.0 % من المواقع لم تكتب لهذه الروبوتات قاعدة واحدة.
- أن الحجب تمييز خاص بالذكاء الاصطناعي: المواقع نفسها تُدخل روبوتات البحث الكلاسيكية، والفارق يتجاوز 25 ضعفًا.
- أن الفارق يعود في معظمه إلى الإعدادات الافتراضية للمنصة المستخدمة: الفارق الوسيط بين المنصات أكبر من الفارق بين القطاعات.
- أن المواقع الـ 155 التي لا يأتي محتواها إلا مع JavaScript تبدو فارغة للزواحف التي لا تشغّله.
- «الذكاء الاصطناعي لا يجد هذه الشركات» — لم يُسأل أي نموذج شيئًا؛ قِيست الشروط لا النتائج.
- «هذا الموقع مخطئ لأنه يحجب الذكاء الاصطناعي» — الحجب خيار مشروع ويُحسب هنا قرارًا.
- «X % من المواقع بلا مخطط» — والصواب: «لم يُرصد في الصفحة الرئيسية»؛ فالصفحات الداخلية والصيغ خارج JSON-LD لم تُرَ.
- أن نسب الروبوتات دائمة — فأسماء الروبوتات وسياساتها تتغير خلال أشهر.
- أن المواقع التي تنشر llms.txt قد اتخذت قرارًا بشأن الذكاء الاصطناعي — فأكثر من نصف الملفات أنتجتها إضافة برمجية تلقائيًا.
الحدود
- مقطع زمني واحد.
- قِيس robots.txt وllms.txt على حالهما وقت الجلب. وقد يكون موقع قد غيّر قاعدته في اليوم التالي؛ وهذه الدراسة تُظهر تلك اللحظة لا التغيّر.
- قِيست الشروط لا النتائج.
- لم يُقَس أي موقع يستشهد به المساعدون فعلًا. والإذن لا يضمن الاستشهاد؛ والحجب لا يعني الاختفاء التام.
- الروبوتات ليست ملزمة باتباع robots.txt.
- الملف اتفاق طوعي. وبعض الروبوتات لا تتبعه. ولهذا فعبارة «حجب» لا تعني «لم يدخل» بل تعني «طلب منه ألّا يدخل».
- قُرئ JSON-LD وحده.
- قُيّمت البيانات المنظَّمة عبر كتل JSON-LD فقط. أما microdata وRDFa فخارج النطاق؛ والمواقع التي تستخدم هاتين الصيغتين تظهر هنا بوصفها «بلا مخطط».
- قياسات المحتوى محدودة بالصفحة الرئيسية.
- لا يُرى عمق صفحات المدونة والخدمات والتواصل. وقد يبدو موقع ذو بنية داخلية غنية منخفضًا بسبب صفحة رئيسية نحيفة.
- إسناد القطاع استدلال تقريبي.
- يُشتق القطاع من عبارة البحث التي وجدت الشركة. وفي الشركات متعددة الخدمات يمكن الدفاع عن إسناد آخر؛ وترتيبات القطاعات مرهونة بهذه القاعدة.
- فروق الأقضية تحمل عيّنة صغيرة.
- في ثلاثة أقضية يقل عدد المواقع المفحوصة عن 30. وتبقى هذه السطور في الجدول لكنها لا تدخل المقارنة ولا تُنقل إلى عنوان.
قواعد الاقتباس
هذه القواعد الست ليست مسألة أسلوب. فتأطير رقم خطأً في هذا التقرير يحوّل خيارًا إلى عيب، أو مقياس جاهزية إلى نبوءة.
- 01الحجب خيار لا خطأ؛ و«لم يكتب قاعدة» و«حجب» يُذكران منفصلين.
- 02الدرجة مقياس ظهور لا حكم جودة؛ والدرجة المنخفضة لا تعني شركة سيئة.
- 03بما أن الصفحة الرئيسية وحدها قِيست، فنسب المحتوى والمخطط حدّ أدنى.
- 04قائمة الروبوتات مؤرَّخة؛ وفي تاريخ آخر ستكون هناك روبوتات أخرى.
- 05لا يُقال «الذكاء الاصطناعي لا يجد هذه الشركة»؛ بل يُقال «تنقص الشروط اللازمة للإجابة من هذا الموقع».
- 06llms.txt ما زال اقتراح مسوَّدة؛ ويُعرض غيابه مقياسَ تبنٍّ لا نقصًا.
المنهجية باختصار
- 01المجتمع المدروسبيانات دراسة «مرسين / State of Digital 2026»: 4,167 نطاقًا مفحوصًا، منها 3,395 يمكن الوصول إليه. ومجتمع الشركات هو 19,615 شركة محلية تظهر نشطة على Google؛ وخلف هذه المواقع 3,928 شركة.
- 02الجلب وقواعد التهذيبثلاثة طلبات GET كحد أقصى لكل نطاق: /robots.txt و/llms.txt و/llms-full.txt. واستُخدم User-Agent يعرّف بنفسه، وتزامن منخفض، وانتظار بين الطلبات. وقُرئ robots.txt أولًا، ولم تُرسل طلبات llms.txt إلى المواقع التي تحجب روبوت البحث هذا. وكُتبت النتائج في قاعدة بيانات، فإعادة التشغيل لا تنتج طلبات جديدة.
- 03كيف قُيّم robots.txtقُيّم لكل روبوت المسار الجذر ("/") فقط. والمطابقة غير حساسة لحالة الأحرف، وقاعدة أطول مسار تفوز، وعند التساوي يتقدم allow، والمطابقة التامة للرمز تغلب مجموعة البدل. و«لا قاعدة» و«محجوب» عُدّا منفصلين.
- 04البيانات المنظَّمة والمحتوىقُرئ HTML الصفحات الرئيسية من ذاكرة 2026·08·25؛ ولم يُرسل لهذا القسم طلب جديد. وحُلِّلت كتل JSON-LD وعُدّت الكتل المعطوبة على حدة. وأُجريت قياسات المحتوى على HTML الساكن.
- 05اختبار JavaScriptإن قلّ نص HTML الساكن عن 120 كلمة وكانت الصفحة التي رآها Playwright أكبر من 2.5 ضعف، عُدّ المحتوى معتمدًا على JavaScript. وأمكن تشغيل هذا الاختبار على 3,364 موقعًا.
- 06الدرجة والعتباتخلاصة موزونة من 0 إلى 100 لستة مكوّنات؛ ويسقط المكوّن غير القابل للقياس من البسط والمقام، وتحت تغطية 60 % لا تُنشر درجة. قُيّم 3,382 موقعًا وتعذّر تقييم 13. ولم تدخل القطاعات المقارنة إلا بـ50 موقعًا مفحوصًا فأكثر؛ وتجاوز هذه العتبة 30 قطاعًا.
| نطاقات مفحوصة | 4,167 |
|---|---|
| مواقع جُلب منها robots.txt | 3,395 |
| مواقع صفحتها الرئيسية قابلة للقراءة | 3,382 |
| مواقع قابلة للتقييم | 3,382 |
| الشركات خلف المواقع | 3,928 |
المصادر
- 01جلب robots.txt / llms.txt (هذه الدراسة)القياس الميداني الجديد الوحيد في السلسلة. أُرسل لكل نطاق ثلاثة طلبات GET كحد أقصى: /robots.txt و/llms.txt و/llms-full.txt. ولم تُطلب أي صفحة أخرى. ونافذة الجلب 2026·08·27 من 16:28 إلى 16:44 UTC. وقُرئ robots.txt أولًا؛ ولم تُرسل طلبات llms.txt إلى المواقع التي تحجب روبوت البحث هذا في المسار الجذر.
- 02Nixeny Dijital · مرسين / State of Digital 2026المجتمع المدروس نفسه ومجموعة الشركات نفسها. النطاقات الـ 4,167 والمواقع الـ 3,395 التي يمكن الوصول إليها وذاكرات الصفحات الرئيسية الـ 3,382 التي يستخدمها هذا التقرير من تلك الدراسة؛ وأُخذ HTML الصفحات الرئيسية في 2026·08·25. وأُجريت قياسات البيانات المنظَّمة والمحتوى على تلك الذاكرة، ولم يُعَد إرسال أي طلب.nixeny.com
- 03قائمة الروبوتات19 رمز user-agent: روبوتات OpenAI وAnthropic وPerplexity وGoogle وApple وMeta وByteDance وCommon Crawl وAmazon وCohere وYou.com وDiffbot، إضافة إلى Googlebot وBingbot مجموعةَ ضبط. والقائمة مؤرَّخة ومذكورة صراحةً في `config/ai-readiness.json`؛ وفي تاريخ آخر ستكون هناك روبوتات أخرى.
- 04قواعد تفسير robots.txtيُقيَّم لكل روبوت المسار الجذر فقط. والمطابقة غير حساسة لحالة الأحرف، وقاعدة أطول مسار تفوز، وعند التساوي يتقدم allow، والمطابقة التامة للرمز تغلب مجموعة البدل (*).www.rfc-editor.org
- 05schema.org · LocalBusinessتعريف حقول البيانات المنظَّمة. والحقول المطلوبة في هذه الدراسة: name وaddress وtelephone وopeningHours / openingHoursSpecification وgeo وpriceRange وaggregateRating.schema.org
- 06اقتراح llms.txtالمسوَّدة التي تحدد صيغة الملف. وهو اقتراح لا معيار؛ ويقيس هذا التقرير التبنّي لا الامتثال.llmstxt.org
لم تُقارَن أرقام هذا التقرير بقياس محافظة أو بلد آخر. فـ«متوسط عالمي» أُنتج بقائمة روبوتات مختلفة وفي تاريخ مختلف وعلى أساس مختلف يبدو، حين يوضع جنبًا إلى جنب، وكأن الرقمين يقيسان الشيء نفسه. أما المشترك مع مرسين / State of Digital 2026 فهو المجتمع المدروس وتاريخ ذاكرة الصفحات الرئيسية؛ وجلب robots.txt خاص بهذه الدراسة وقد جرى بعد ذلك بيومين.
بيانات النشر
أُجريت ونُشرت من Nixeny Dijital، مرسين. الجلب واحتساب الدرجات وتصميم التقرير من إنجاز Nixeny. والمجتمع المدروس وقائمة المواقع مشتركان مع دراسة «مرسين / State of Digital 2026». وأُرسل لأجل هذا التقرير ثلاثة طلبات كحد أقصى لكل نطاق: robots.txt وllms.txt وllms-full.txt.
إن أرادت شركة معرفة سطر موقعها في هذه الدراسة، يكفي أن تكتب اسم النطاق. وتُشارَك المنهجية وقائمة الروبوتات وسجلات التحقق أيضًا عند الطلب: info@nixeny.com