Nixeny Dijital - Mersin / AI Readiness 2026
У 3 395 корпоративных сайтов Мерсина был запрошен файл robots.txt, и 3 382 главных страниц изучены на машиночитаемость. Доля сайтов, на которых ассистент может ответить на вопрос «где эта компания, когда она открыта, какой у неё телефон» прямо с сайта, составляет 4,5 %. Один вопрос: что компании Мерсина рассказывают машине?
Что эти цифры измеряют и чего не измеряют
В этом исследовании ни одной ИИ-модели не было задано ни одного вопроса. То, какую компанию ассистенты на самом деле цитируют, не измерялось. Измерялось лишь одно: выполнены ли условия, нужные ассистенту, чтобы получить ответ с этого сайта. Фраза «ИИ не находит эту компанию» из этих данных не следует.
Блокировать ИИ-краулеров — законное решение, и в этом отчёте оно считается решением, а не ошибкой. 3021 сайт, не написавший ни одного правила, и 331 сайт, блокирующий осознанно, ни в одной таблице не объединяются: первые никогда не обсуждали этот вопрос, вторые обсудили и решили.
Измерения содержимого и структурированных данных выполнены только по главной странице. Схема, список услуг или частые вопросы на внутренних страницах не видны. Это значит, что все доли по схеме и содержимому здесь — НИЖНЯЯ ГРАНИЦА: реальная доля может быть выше, но не ниже.
Имена ботов и их политики меняются за месяцы; бот, которого сегодня нет, через год может возглавить список. Доли здесь осмысленны только вместе со стоящим рядом списком из 19 ботов и не переносятся на другую дату.
Глоссарий · каждый термин объяснён один раз
- ИИ-видимость
- Тема этого отчёта: сколько из условий, нужных ИИ-ассистенту, чтобы получить ответ с корпоративного сайта, выполнено. Не оценка качества, а мера читаемости.
- База
- В этом отчёте три основные базы: 3395 сайтов с запрошенным robots.txt, 3382 сайта с читаемой главной страницей и 4167 проверенных доменов. Внутри разделов есть и более узкие (генераторы llms.txt считаются по 352 файлам). Рядом с каждой долей указано, о какой из них речь.
- robots.txt
- Текстовый файл в корне сайта, сообщающий, какому боту куда можно. Он добровольный, а не обязывающий: боты сами решают его соблюдать. В этом исследовании для каждого бота оценивался только корневой путь ("/").
- Обучающий бот / поисковый бот
- Обучающий бот (GPTBot, ClaudeBot, Google-Extended) собирает содержимое, чтобы обучить модель. Поисковый бот (OAI-SearchBot, PerplexityBot) находит и цитирует источник, когда задан вопрос. Блокировать обоих одним правилом значит закрыть и возможность быть процитированным.
- Нет правила ≠ заблокировано
- Если в robots.txt для бота нет правила, поведение по умолчанию — разрешать доступ. Поэтому сайты, «не написавшие ни одного правила», и сайты, «блокирующие осознанно», нигде в этом отчёте не попадают в одну корзину.
- Структурированные данные (JSON-LD)
- Встроенная в страницу информация в виде, который машина читает напрямую: название, адрес, телефон, часы работы. Человеку не видна. В этом исследовании читался только JSON-LD; микроданные и RDFa вне охвата.
- Схема LocalBusiness
- Тип структурированных данных, который говорит: «это местная компания». Это стандартный способ представиться машине как компания; без него ассистенту приходится угадывать, что это за страница, по тексту.
- Тройка «название-адрес-телефон»
- Наличие в структурированных данных всех трёх: названия компании, точного адреса и телефона. Если одного из трёх нет, ассистент либо не даёт ответ, либо берёт его из другого источника — чаще всего из справочника.
- llms.txt
- Файл, предложенный для того, чтобы кратко изложить ИИ-ассистентам содержимое сайта. Пока это черновое предложение, а не стандарт. Поэтому его отсутствие отражается не как недостаток, а как мера распространённости.
- Отвечаемость
- Выполнение всех четырёх условий, нужных ассистенту, чтобы ответить на вопрос «где эта компания, когда она открыта, какой у неё телефон» прямо с сайта: поиск не заблокирован, тройка «название-адрес-телефон» полна, часы работы есть и содержимое видно без запуска JavaScript.
- Зависимость от JavaScript
- В статическом HTML меньше 120 слов текста, а отрисованная браузером страница показывает больше чем в 2,5 раза больше. Главные страницы этих сайтов выглядят пустыми для браузера, не выполняющего JavaScript.
- Балл видимости
- Взвешенная сводка 0-100 из шести компонентов: разрешение доступа (25), структурированные данные (25), глубина содержимого (20), техническая основа (15), готовность к ответу (10), llms.txt (5). Неизмеримый компонент выпадает и из числителя, и из знаменателя; при покрытии ниже 60 % балл не публикуется.
Четыре сайта из ста могут ответить на вопрос
Чтобы ИИ-ассистент мог ответить на самый обычный вопрос о компании — где она, когда открыта, какой у неё телефон — прямо с сайта самой компании, нужны четыре вещи: robots.txt не должен блокировать поиск, тройка «название-адрес-телефон» в структурированных данных должна быть полной, часы работы должны быть там же, а содержимое должно быть видно и без запуска JavaScript.
Всем четырём отвечают 152 сайтов — 4,5 %. Эти сайты представляют 170 компаний. Для остальных ассистент либо молчит, либо берёт ответ откуда-то ещё, чаще всего из справочника.
Каждый столбик — число сайтов, не выполняющих это одно условие. Сайт может споткнуться сразу на трёх, поэтому строки не суммируются и не читаются как разбиение; порядок задан тем, как часто условие срабатывает.
89,0 % сайтов не написали для ИИ ни одного правила
robots.txt — это файл, в котором сайт сообщает, какого бота и куда он пускает. 2 227 сайтов (65,6 %) имеют такой файл; но число сайтов, где внутри есть хотя бы одно правило для ИИ-краулеров, — всего 374. Для остальных 3 021 сайтов тема ещё не поднималась.
Не написать правило — не значит заблокировать: если в robots.txt для бота нет положения, поведение по умолчанию — разрешать доступ. Поэтому эти две строки нигде в отчёте не объединяются. Одни никогда не обсуждали вопрос, другие обсудили и решили.
Семь прочтений одного и того же файла по одной базе. Строка «задано хотя бы одно правило» — сумма решений разрешить и запретить; две строки под ней делят эту сумму. Строка Googlebot — контрольная.
Состояние сайтов можно увидеть одним разбиением. Четыре корзины ниже охватывают все 3 395 сайтов и в сумме дают базу — но корзина «закрыто» не низ рейтинга, а нечто вне остальных трёх. Сайт там ответил на вопрос; сайт в корзине «невидимо» с этим вопросом не встречался.
Каждый из ста квадратов представляет примерно 34 сайтов. Корзины взаимоисключающие и в сумме дают базу.
ИИ-краулеров блокируют в 25 раз чаще поисковых
Единственный способ понять, общая ли это закрытость или различие, специфичное для ИИ, — посмотреть, что те же сайты делают с классическими поисковыми ботами. 331 сайтов блокируют в корне хотя бы одного ИИ-краулера; Googlebot и Bingbot блокируют 13 сайтов. Разница — 25,5 раза.
То есть отвергается не сканирование, а определённое использование просканированного. Те же сайты пускают поисковые машины внутрь.
Четыре группы, одна база. Контрольная группа — классические поисковые боты: Googlebot и Bingbot. Столбец «упомянут» считает случаи, когда сайт пишет имя этой группы в robots.txt: упомянуть не значит заблокировать, бот может быть упомянут и для того, чтобы его разрешить.
При взгляде бот за ботом видно, что блокировка — работа со списком: доли блокировки обучающих ботов очень близки друг к другу, потому что одни и те же сайты перечисляют их одним блоком. В нескольких строках блокирующих больше, чем упомянувших, — там правило пишет групповой шаблон (*), и собственное имя бота в файле не встречается.
Каждая строка — токен user-agent. Цвет показывает задачу бота: красный — обучение, тёмно-синий — поиск, светло-синий — загрузка по запросу пользователя, серый — классический поиск (контроль).
| Бот | Задача | Упомянут | Блокируют | Доля |
|---|---|---|---|---|
| GPTBot (OpenAI, обучение) | обучение | 346 | 312 | 9,2 % |
| OAI-SearchBot (поиск ChatGPT) | поиск | 62 | 40 | 1,2 % |
| ChatGPT-User (по запросу пользователя) | запрос пользователя | 160 | 135 | 4,0 % |
| ClaudeBot (Anthropic, обучение) | обучение | 336 | 308 | 9,1 % |
| Claude-User (по запросу пользователя) | запрос пользователя | 40 | 40 | 1,2 % |
| Claude-SearchBot (поиск Claude) | поиск | 43 | 41 | 1,2 % |
| PerplexityBot (поисковый индекс) | поиск | 171 | 131 | 3,9 % |
| Perplexity-User (по запросу пользователя) | запрос пользователя | 32 | 38 | 1,1 % |
| Google-Extended (обучение Gemini) | обучение | 334 | 305 | 9,0 % |
| Applebot-Extended (Apple Intelligence) | обучение | 316 | 305 | 9,0 % |
| meta-externalagent (Meta AI) | обучение | 214 | 218 | 6,4 % |
| Bytespider (ByteDance) | обучение | 309 | 313 | 9,2 % |
| CCBot (Common Crawl) | обучение | 320 | 318 | 9,4 % |
| Amazonbot | обучение | 303 | 308 | 9,1 % |
| cohere-ai | обучение | 44 | 45 | 1,3 % |
| YouBot (You.com) | поиск | 127 | 131 | 3,9 % |
| Diffbot | обучение | 125 | 136 | 4,0 % |
| Googlebot (классический поиск) | классический поиск | 68 | 11 | 0,3 % |
| Bingbot (классический поиск + Copilot) | классический поиск | 40 | 13 | 0,4 % |
У 352 сайтов есть llms.txt; половину написал плагин
llms.txt — файл, предложенный для того, чтобы кратко изложить ИИ-ассистентам содержимое сайта. Это пока не стандарт, а черновое предложение — поэтому его отсутствие следует читать как меру распространённости, а не как недостаток. Он есть у 352 сайтов (10,4 %); более подробный llms-full.txt — лишь у 30.
Главная находка — не сама цифра, а то, кто её написал. 183 из этих 352 файлов (52,0 %) созданы автоматически плагином или платформой. То есть эта цифра измеряет не решение компаний об ИИ, а примечания к выпуску инструмента, которым они пользуются.
Две разные базы, одна над другой. Доли в нижнем блоке — распределение существующих файлов, а не суммы сайтов: если читать их по 3395, каждая строка окажется на порядок неверной.
Сайты, где машина может прочитать часы работы: 5,7 процента
Структурированные данные — это встроенная в страницу информация, которую видит только машина: название, адрес, телефон, часы работы. Доля сайтов, у которых на главной странице есть хоть какой-то блок JSON-LD, — 33,9 %. Но дальше вниз число падает на каждом шаге: представляются компанией 10,7 %, имеют полную тройку «название-адрес-телефон» 13,5 %, указывают часы работы 5,7 %.
Это падение и есть тема отчёта. Единственное поле, нужное ассистенту, чтобы ответить «открыто ли сейчас», есть у одного сайта из двадцати.
Сужающийся ряд: сначала любой JSON-LD, затем типы компаний, затем три сведения, которые ассистенту действительно нужны, чтобы ответить на вопрос.
Процент полноты по восьми полям. Медиана равна нулю: больше чем у половины сайтов нет ни одного засчитываемого поля, поэтому вместо среднего приводится само распределение.
Типы, которые ассистент может процитировать напрямую. FAQPage и Question несут готовый ответ на вопрос; Offer, Service и Product сообщают, что это за услуга и сколько она стоит.
Главные страницы 155 сайтов выглядят для краулера пустыми
Если структурированных данных нет, остаётся сам текст. Медианная главная страница содержит 382 слов; четверть из них — меньше 176. У большинства сайтов есть что прочитать: 81,7 % сайтов находятся в корзине «достаточно» или «богато».
Проблема на краях. Содержимое 155 сайтов появляется только при выполнении JavaScript — то есть ИИ-краулер, не выполняющий JavaScript, увидит эту главную страницу пустой. Кроме того, на главных страницах 150 сайтов меньше 120 слов текста.
Четыре корзины по числу слов статического текста на главной странице. Корзины взаимоисключающие и в сумме дают базу.
Шесть признаков, которые ассистент ищет в тексте, когда структурированных данных нет. Телефонная ссылка (tel:) машиночитаема без всякой схемы; это единственная строка выше половины.
Эти две строки — не одни и те же сайты и не суммируются: первая считает сайты, подгружающие текст позже, вторая — те, у которых на главной странице текста нет вовсе. Итог в обоих случаях один: бот, не выполняющий страницу как браузер, не находит там ничего для чтения.
Медианный сайт получает ноль по двум компонентам из шести
Шесть компонентов дают взвешенный балл 0-100: разрешение доступа (25), структурированные данные (25), глубина содержимого (20), техническая основа (15), готовность к ответу (10) и llms.txt (5). Медиана 53,8, квартили — между 44,5 и 63,7.
Балл — не оценка качества, а мера видимости: низкий балл не значит плохую компанию, он значит, что машине меньше что читать. Разбор по компонентам показывает, откуда берётся распределение: медианный сайт получает полный балл за разрешение доступа и ноль по двум компонентам.
Пять корзин, в сумме равных базе. Распределение собирается посередине: половина сайтов в полосе 40-59.
Каждый из ста квадратов представляет примерно 34 сайтов.
Вес компонента указан рядом. У двух компонентов медиана равна нулю: это не пробел в данных, а сама находка — больше чем у половины сайтов нет ни структурированных данных, ни llms.txt.
Решает не отрасль, а установленная платформа
Разрыв между отраслями узок. Медианы 30 отраслей зажаты между 33,8 и 64,4, а их медиана — 52,9. Разрыв между платформами больше: 68,9 у Wix, 48,8 у собственных разработок.
Яснее всего это показывает строка со схемой LocalBusiness: 53,7 % сайтов на Wix представляются машине компанией, против 8,9 % у собственных разработок. Разницу между сайтом адвоката и сайтом автосервиса создают не адвокатура и не ремонт машин, а инструмент, на котором собраны эти два сайта.
Две базы в одной строке не совпадают, и не должны: медианный балл считается по всем опрошенным сайтам, а доля LocalBusiness — по тем, чью главную страницу удалось прочитать.
| Платформа | Сайтов | Медианный балл | LocalBusiness | Назв.-адр.-тел. | Отвечаемость |
|---|---|---|---|---|---|
| Wix | 121 | 68,9 | 53,7 % | 43,8 % | 1,7 % |
| Ticimaxсравнение | 48 | 66,9 | 4,2 % | 81,3 % | 4,2 % |
| Next.js | 146 | 61,4 | 39,0 % | 39,0 % | 19,2 % |
| WordPress | 559 | 59,4 | 7,7 % | 8,8 % | 3,8 % |
| WooCommerce | 386 | 58,8 | 5,2 % | 5,7 % | 2,3 % |
| IdeaSoftсравнение | 37 | 56,3 | 0,0 % | 5,4 % | 0,0 % |
| Собственная разработка | 1 912 | 48,8 | 8,9 % | 11,2 % | 4,6 % |
Каждый штрих — медианный балл одной отрасли. Высота штриха информации не несёт; она меняется по трёхтактному циклу лишь для того, чтобы совпадающие значения оставались различимыми. Красная линия — медиана отраслевых медиан.
Находка этого рисунка — его плоскость. Тогда как по другим измерениям серии между районами разница в разы, ИИ-видимость с географией не движется.
Это исследование не задало ИИ ни одного вопроса
Все цифры этого отчёта измеряют готовность: сколько из того, что нужно ассистенту, чтобы получить ответ с этого сайта, находится на месте. Ни одна из них не измеряет, что ассистент делает на самом деле.
В этом исследовании ни одной модели не был задан ни один вопрос. Фраза «часов работы нет в структурированных данных» верна и проверяема; фраза «ИИ не находит эту компанию» из этих данных не следует. Ассистенты получают ответы и из справочников, и из картографических сервисов, и из источников, на которые это исследование вовсе не смотрело. Этот разрыв отчёт и не собирался закрывать.
Точно так же то, что 331 сайтов блокируют ИИ-краулеров, — не изъян. Компания может не хотеть, чтобы её содержимое использовали для обучения моделей, и говорится это именно так. Этот отчёт считает такое решение, но не оценивает его.
- Что сайты местных компаний не настроены отвечать ИИ-ассистентам — доля сайтов, выполняющих все четыре условия, 4,5 %.
- Что тема ИИ-краулеров ещё не стоит на повестке местных компаний: 89,0 % сайтов не написали для этих ботов ни одного правила.
- Что блокировка — различие, специфичное для ИИ: те же сайты пускают классических поисковых ботов, разница более чем в 25 раз.
- Что разница в основном идёт из настроек используемой платформы по умолчанию: медианный разрыв между платформами больше разрыва между отраслями.
- Что 155 сайтов, содержимое которых приходит только с JavaScript, выглядят пустыми для краулеров, его не выполняющих.
- «ИИ не находит эти компании» — ни одной модели ничего не задавалось; измерялись условия, а не результаты.
- «Этот сайт поступает неправильно, блокируя ИИ» — блокировка является законным выбором и считается здесь решением.
- «У X % сайтов нет схемы» — верная формулировка: «не обнаружена на главной странице»; внутренние страницы и форматы вне JSON-LD не рассматривались.
- Что доли по ботам устойчивы — имена ботов и их политики меняются за месяцы.
- Что сайты с llms.txt приняли решение об ИИ — больше половины файлов автоматически создал плагин.
Ограничения
- Один срез во времени.
- robots.txt и llms.txt измерены в том состоянии, в каком находились в момент запроса. Сайт мог изменить своё правило на следующий день; это исследование показывает тот момент, а не изменение.
- Измерялись условия, а не результаты.
- То, какой сайт ассистенты цитируют на самом деле, не измерялось. Быть разрешённым не гарантирует цитирования; быть заблокированным не значит быть невидимым.
- Боты не обязаны соблюдать robots.txt.
- Файл — добровольное соглашение. Некоторые боты его не соблюдают. Поэтому «заблокировал» не значит «не вошёл», а значит «попросил не входить».
- Читался только JSON-LD.
- Структурированные данные оценивались только по блокам JSON-LD. Микроданные и RDFa вне охвата; сайты, использующие эти форматы, выглядят здесь как «схемы нет».
- Измерения содержимого ограничены главной страницей.
- Глубина страниц блога, услуг и контактов не видна. Сайт с богатой внутренней структурой может выглядеть низко из-за скудной главной страницы.
- Отнесение к отрасли — эвристика.
- Отрасль выводится из поискового запроса, по которому нашлась компания. Для компаний с несколькими направлениями можно защищать и другое отнесение; отраслевые рейтинги зависят от этого правила.
- Различия между районами опираются на малую выборку.
- В трёх районах число проверенных сайтов меньше 30. Эти строки остаются в таблице, но в сравнение не входят и в заголовки не выносятся.
Правила цитирования
Эти шесть правил — не вопрос стиля. Неверно поданная цифра в этом отчёте превращает выбор в изъян, а меру готовности — в пророчество.
- 01Блокировка — это выбор, а не ошибка; «не написал правила» и «заблокировал» приводятся раздельно.
- 02Балл — мера видимости, а не оценка качества; низкий балл не значит плохую компанию.
- 03Поскольку измерялась только главная страница, доли по содержимому и схеме являются нижней границей.
- 04Список ботов датирован; на другую дату будут другие боты.
- 05Не говорить «ИИ не находит эту компанию»; говорить «условий, нужных для ответа с этого сайта, не хватает».
- 06llms.txt пока черновое предложение; его отсутствие подаётся как мера распространённости, а не как недостаток.
Методика, коротко
- 01Генеральная совокупностьНабор данных исследования «Мерсин / State of Digital 2026»: 4167 проверенных доменов, из них 3395 доступны. Совокупность компаний — 19 615 местных компаний, видимых на Google как активные; за этими сайтами стоят 3928 компаний.
- 02Запрос и правила вежливостиНе более трёх GET-запросов на домен: /robots.txt, /llms.txt, /llms-full.txt. Использовались представляющийся User-Agent, низкая параллельность и пауза между запросами. robots.txt читался первым, и на сайты, блокирующие этот исследовательский бот, запросы llms.txt не отправлялись. Результаты записаны в базу данных, поэтому повторный запуск новых запросов не создаёт.
- 03Как оценивался robots.txtДля каждого бота оценивался только корневой путь ("/"). Сопоставление нечувствительно к регистру, побеждает правило с самым длинным путём, при равенстве вперёд идёт allow, а точное совпадение токена перебивает групповой шаблон. «Нет правила» и «заблокировано» считались раздельно.
- 04Структурированные данные и содержимоеHTML главных страниц читался из кэша от 2026·08·25; для этого раздела новых запросов не делалось. Блоки JSON-LD разбирались, испорченные блоки считались отдельно. Измерения содержимого выполнялись по статическому HTML.
- 05Тест JavaScriptЕсли в статическом HTML было меньше 120 слов, а страница, которую видел Playwright, оказывалась более чем в 2,5 раза больше, содержимое считалось зависящим от JavaScript. Этот тест удалось выполнить на 3364 сайтах.
- 06Балл и порогиВзвешенная сводка 0-100 из шести компонентов; неизмеримый компонент выпадает из числителя и знаменателя, а при покрытии ниже 60 % балл не публикуется. Оценено 3382 сайта, 13 оценить не удалось. Отрасли входили в сравнение только при 50 и более проверенных сайтах; этот порог прошли 30 отраслей.
| Проверенные домены | 4 167 |
|---|---|
| Сайты с запрошенным robots.txt | 3 395 |
| Сайты с читаемой главной страницей | 3 382 |
| Оцениваемые сайты | 3 382 |
| Компании за сайтами | 3 928 |
Источники
- 01Запрос robots.txt / llms.txt (это исследование)Единственное новое полевое измерение серии. На домен делалось не более трёх GET-запросов: /robots.txt, /llms.txt и /llms-full.txt. Никакие другие страницы не запрашивались. Окно запросов: 2026·08·27 16:28 → 16:44 UTC. robots.txt читался первым; на сайты, блокирующие этот исследовательский бот в корне, запросы llms.txt не отправлялись.
- 02Nixeny Dijital · Мерсин / State of Digital 2026Та же генеральная совокупность, тот же набор компаний. 4167 доменов, 3395 доступных сайтов и 3382 кэша главных страниц, которыми пользуется этот отчёт, взяты из того исследования; HTML главных страниц получен 2026·08·25. Измерения структурированных данных и содержимого выполнены по этому кэшу, повторных запросов не отправлялось.nixeny.com
- 03Список ботов19 токенов user-agent: боты OpenAI, Anthropic, Perplexity, Google, Apple, Meta, ByteDance, Common Crawl, Amazon, Cohere, You.com и Diffbot, плюс Googlebot и Bingbot как контрольная группа. Список датирован и открыто приведён в `config/ai-readiness.json`; на другую дату будут другие боты.
- 04Правила толкования robots.txtДля каждого бота оценивается только корневой путь. Сопоставление нечувствительно к регистру, побеждает правило с самым длинным путём, при равенстве вперёд идёт allow, а точное совпадение токена перебивает групповой шаблон (*).www.rfc-editor.org
- 05schema.org · LocalBusinessОпределение полей структурированных данных. Искомые в этом исследовании поля: name, address, telephone, openingHours / openingHoursSpecification, geo, priceRange и aggregateRating.schema.org
- 06Предложение llms.txtЧерновик, определяющий формат файла. Это предложение, а не стандарт; отчёт измеряет распространённость, а не соответствие.llmstxt.org
Цифры этого отчёта не сравнивались с измерениями другой провинции или страны. «Среднемировой» показатель, полученный по другому списку ботов, на другую дату и по другой базе, при постановке рядом выглядит так, будто обе цифры измеряют одно и то же. С Мерсин / State of Digital 2026 общие генеральная совокупность и дата кэша главных страниц; запрос robots.txt принадлежит только этому исследованию и сделан двумя днями позже.
Выходные данные
Проведено и опубликовано Nixeny Dijital, Мерсин. Запрос, расчёт баллов и дизайн отчёта выполнены Nixeny. Генеральная совокупность и список сайтов общие с исследованием «Мерсин / State of Digital 2026». Для этого отчёта на домен отправлялось не более трёх запросов: robots.txt, llms.txt и llms-full.txt.
Если компания хочет узнать свою строку в этом исследовании, достаточно написать доменное имя. Методика, список ботов и журналы проверки также предоставляются по запросу: info@nixeny.com