Почему ИИ цитирует одни страницы и игнорирует другие

Между двумя страницами с одним и тем же знанием не качество решает, какую процитируют. Решает, можно ли выделить из одной из них предложение, которое стоит само по себе и проверяемо.

Из поля одинаковых слабых форм ровно одну захватывает свет, и она выступает вперёд

Самое важное вкратце

  • Цитируют абзацы, а не страницы — поэтому расположение решает больше, чем общее качество.
  • Шесть свойств общи для цитируемых источников: выделяемый ответ, проверяемое сведение, распознаваемая ответственность, актуальность, техническая читаемость и тематическая близость.
  • Три причины исключают сильные страницы: содержимое возникает лишь через JavaScript, страница заблокирована, или утверждения лишь распределены по сплошному тексту.
  • Проверяемое собственное сведение — самый сильный отдельный фактор: это причина, по которой модель называет вас, а не общий источник.

Когда система строит ответ, она выбирает источники не по симпатии или авторитету, а по пригодности. Вопрос всегда один и тот же: даёт ли эта страница фрагмент текста, который отвечает на заданный вопрос, понятен сам по себе и может быть подтверждён?

Шесть свойств

1. Выделяемый ответ

Абзац, который полностью отвечает на вопрос в двух-четырёх предложениях, не отсылая к окружающему тексту. Самое важное свойство с большим отрывом — и единственное, которое полностью в вашей власти.

2. Проверяемое собственное сведение

Число, метод, период, опыт с областью применения. Это причина, по которой модель называет вас, а не общий источник: вы говорите что-то, чего нет в другом месте.

3. Распознаваемая ответственность

Автор с ролью, компания с адресом, дата последней проверки — видимо на странице и в структурированных данных, с тем же значением. Особенно важно при темах, которые касаются денег, здоровья или права.

4. Прослеживаемая актуальность

Дата, которая верна, и содержимое, которое к этой дате подходит. Дата изменения вчерашним числом при тексте, описывающем давно устаревшее состояние, хуже, чем никакая.

5. Техническая читаемость

Содержимое стоит в доставленном HTML, а не только после выполнения JavaScript. Чистая иерархия заголовков, никакой блокировки в robots.txt для обращений во время работы.

6. Тематическая близость окружения

Страница в поле, которое сайт заметно занимает, скорее будет расценена как экспертный источник, чем отдельный материал среди двадцати несвязанных тем. Это причина, почему тематические кластеры работают.

А ты знал?

Свойство два — настоящий рычаг для малых предприятий. При общем знании вы конкурируете с крупными порталами и проигрываете — там нет причины называть именно вас.

При проверяемом собственном сведении источник — вы. «На практике чистка разросшегося списка контактов занимает один-три дня» — это не общеизвестное утверждение, оно исходит от того, кто это делал, и именно поэтому оно пригодно для цитирования. Одно предложение с собственным опытом весит больше, чем три абзаца пересказа.

Три причины, по которым сильные страницы выпадают

ПричинаПо чему её узнатьЗатраты на устранение
Содержимое возникает лишь в браузереИсходный код страницы не содержит текставысокие — вопрос архитектуры
Обращения во время работы заблокированыrobots.txt блокирует ChatGPT-User и прочихминуты
Утверждения лишь распределены по сплошному текстуни один абзац не отвечает на вопрос в одиночкусредние — перестройка абзацев

Вторая причина самая досадная, потому что устраняется за минуты и всё же часто встречается — обычно как побочный эффект огульной блокировки «всех ИИ-ботов».

Из практики

Закономерность, которая проявляется при анализе цитируемых источников: это редко объёмные обзорные материалы. Это короткие страницы, которые полностью отвечают ровно на один вопрос, — часто такие, что в собственном доме считаются побочным продуктом.

Материал в 900 слов с ясным числом и названной областью применения цитируется чаще, чем руководство в 2500 слов на ту же тему, в котором то же число стоит в одиннадцатом абзаце. Для планирования контента это значит: больше чётко отграниченных отдельных вопросов, меньше всеобъемлющих руководств.

Что можно сделать конкретно

  1. Сделать тест на выделяемость. Скопировать любой абзац в пустой документ: отвечает ли он в одиночку на распознаваемый вопрос? У большинства материалов проходят два абзаца из десяти.
  2. Добавить собственные сведения. Для каждого материала как минимум одно число, метод или опыт с областью применения — из собственной работы, а не из источника.
  3. Краткую сводку наверх. Четыре полных утверждения. Пятнадцать минут на материал, без изменения содержания.
  4. Проверить обращения во время работы. В robots.txt посмотреть, допущены ли ChatGPT-User, Perplexity-User и Claude-User.
  5. Проанализировать серверный журнал. Забираются ли ваши страницы вообще? Без доступа нет цитирования — и это другой участок работ, чем цитируемость.
Prompt
Оцени, почему эту страницу цитировали бы ответные машины
или нет. Будь строг; ничего не хвали; текст не переписывай.

Текст страницы:
[вставить текст]

Дополнительные сведения:
- Стоит ли содержимое в доставленном HTML? [да / нет / неизвестно]
- Видны ли автор, роль и дата проверки? [да / нет]
- Какое поле наш сайт занимает ещё? [темы]

Задачи:
1. Проверь шесть свойств по отдельности — выделяемый ответ,
   проверяемое собственное сведение, распознаваемая
   ответственность, актуальность, техническая читаемость,
   тематическая близость окружения. Дай по каждому свойству
   выполнено/частично/не выполнено с обоснованием на примере из текста.
2. Назови три абзаца, которые скорее всего процитировали бы, и
   скажи по каждому, на какой вопрос он отвечает.
3. Назови каждое утверждение в тексте, которое могло бы стоять
   и на любой другой странице, — то есть не содержит ничего
   собственного.
4. Сформулируй три вопроса ко мне, ответы на которые дали бы
   проверяемые собственные сведения, которых тексту сегодня
   не хватает.

Не выдумывай чисел и источников.

Вывод

Цитируют то, что можно выделить и что говорит нечто, чего нет в другом месте. И то, и другое — вопрос расположения и субстанции, а не общего качества материала.

Для малых предприятий рычаг однозначно в свойстве два: при общем знании нет причины называть вас. При собственном числе с названной областью применения источник — вы.

Частые вопросы

Почему ИИ цитирует одни страницы и не цитирует другие?

Потому что он выбирает абзацы, а не страницы. Цитируют то, что можно выделить и что остаётся понятным само по себе, что содержит проверяемое сведение, где распознаваемо, кто за этим стоит, что актуально и технически читаемо — и что стоит в поле, которое сайт заметно занимает.

Какой самый сильный отдельный фактор?

Проверяемое собственное сведение: число, метод, опыт с названной областью применения. При общем знании нет причины называть именно малое предприятие — при собственном сведении источник — оно.

Почему содержательно сильную страницу иногда никогда не цитируют?

По трём причинам: содержимое возникает лишь через JavaScript и не стоит в доставленном HTML; обращения во время работы заблокированы в robots.txt, часто как побочный эффект огульной блокировки всех ИИ-ботов; или утверждения распределены по сплошному тексту, так что ни один абзац в одиночку не отвечает на вопрос.

Что цитируют чаще — длинные или короткие материалы?

На практике скорее короткие, чётко отграниченные. Материал около 900 слов с ясным числом и названной областью применения цитируется чаще, чем объёмное руководство, в котором то же число стоит в одиннадцатом абзаце, — потому что короткий материал легче выделить.

Как проверить собственную цитируемость?

С помощью теста на выделяемость: скопировать любой абзац в пустой документ и прочитать. Отвечает ли он в одиночку полностью на распознаваемый вопрос? У большинства материалов проходят примерно два абзаца из десяти — эта доля самая показательная метрика для цитируемости.

Маркетинг, который настраивается сам

Бета Studio Engine уже открыта. Забронируй место и участвуй в развитии с самого начала.

Присоединиться к бете →
← Назад к обзору