acronelab

llms.txt зачем он сайту

llms.txt — это текстовый файл в корне сайта, написанный на Markdown, который объясняет языковой модели, что за проект перед ней и куда смотреть. Предложен Джереми Ховардом в 2024 году. Устроен просто: заголовок первого уровня с названием, цитата с кратким описанием и дальше разделы со ссылками, у каждой из которых есть пояснение. От robots.txt он отличается тем, что ничего не запрещает, а от sitemap.xml — тем, что перечисляет не все адреса подряд, а важные, и объясняет смысл каждого. Главное, что нужно понимать: это предложение сообщества, а не стандарт, и ни один крупный поисковик официально не подтвердил, что читает его. Ставить файл стоит — он стоит полчаса работы и ничего не ломает, — но ждать от него роста трафика не стоит.

7 мин чтенияМакс Шумаков

Что это за файл и откуда взялся

Идею предложил Джереми Ховард, сооснователь fast.ai, в сентябре 2024 года. Наблюдение в её основе простое: языковая модель, которая заходит на сайт, видит HTML со всей его навигацией, скриптами, баннерами и подвалом. Полезного текста там может быть десять процентов, остальное — обвязка. Окно контекста у модели ограничено, и она тратит его на разметку вместо смысла.

llms.txt решает это в лоб: кладём в корень сайта файл на Markdown, где человеческим языком написано, что это за проект и какие страницы имеют значение. Модель читает его вместо того, чтобы разбирать вёрстку.

Формат нарочно примитивный. Заголовок первого уровня — название проекта. Цитата под ним — краткое описание, из которого понятно, чем вы занимаетесь. Дальше разделы с заголовками второго уровня и списки ссылок, где после каждой стоит двоеточие и пояснение, что там лежит.

Чем он отличается от robots.txt и sitemap.xml

Эти три файла часто путают, хотя они отвечают на разные вопросы.

robots.txt отвечает «куда можно, а куда нельзя»

Это система запретов для краулеров. Он не объясняет содержание и не расставляет приоритеты — только разрешает и закрывает разделы.

sitemap.xml отвечает «какие страницы существуют»

Машинный список всех адресов с датами изменения. Он полный, но немой: из него нельзя понять, какая страница важная, а какая служебная.

llms.txt отвечает «что здесь вообще происходит»

Не полный список, а отобранный, и у каждой ссылки есть объяснение. Это ближе к оглавлению книги, чем к описи имущества.

Что о нём известно достоверно, а что нет

Здесь важно быть точным, потому что вокруг темы много уверенных заявлений без оснований.

Достоверно: формат существует, спецификация опубликована, его поддержали несколько сервисов документации, файл легко проверить глазами. Он не может навредить — это обычный текстовый файл, который никак не влияет на индексацию и ранжирование в обычном поиске.

Недостоверно: что OpenAI, Google, Anthropic или Яндекс его читают. Публичных подтверждений этому нет. Заявления вроде «llms.txt повышает видимость в нейросетях на столько-то процентов» ни на чём не основаны — измерить это сегодня нечем.

Практический вывод: делать стоит, потому что дёшево и безвредно. Строить на этом ожидания — нет. Если подрядчик продаёт вам llms.txt как отдельную услугу с обещанием роста, он продаёт вам полчаса работы под видом стратегии.

Как составить его нормально

Три правила, которые отличают полезный файл от формального.

Первое: пишите для человека, а не для робота. Модель обучена на человеческом тексте, и внятное описание она поймёт лучше, чем набор ключевых слов. «Внешний digital-отдел для локального бизнеса, ведение от 50 000 ₽ в месяц» работает, «SEO продвижение сайтов недорого качественно» — нет.

Второе: указывайте цены, сроки и ограничения прямо в файле. Именно эти вещи модель цитирует в ответе, когда у неё спрашивают, к кому обратиться и сколько это стоит. Расплывчатое описание не даст ей что процитировать.

Третье, и это важнее всего: генерируйте файл из тех же данных, что и сайт, а не пишите руками. Написанный вручную файл расходится с сайтом при первом же изменении прайса — и модель начинает называть цену, которой у вас больше нет. На этом сайте llms.txt собирается из тех же файлов, откуда берутся цены на страницах, поэтому разойтись они не могут физически.

Что вместо него действительно работает

Если цель — попадать в ответы нейросетей, llms.txt в этой задаче далеко не первый по значимости. Работают другие вещи, и они проверяемы.

Разметка Schema.org: она читается всеми и однозначно объясняет, что вы за организация, какие услуги оказываете и почём. Прямой ответ в первых 150 словах каждой страницы: модели цитируют начало текста охотнее, чем середину. Упоминания бренда на сторонних площадках: модель называет тех, о ком в сети есть что почитать, а не тех, у кого красивый сайт. Открытые для AI-краулеров настройки в robots.txt: закрытый GPTBot — это добровольный выход из выдачи AI-ответов.

llms.txt в этом списке стоит последним, и это честное место для него.

Вопросы

Что спрашивают по этой теме

Google и Яндекс читают llms.txt?

Официальных подтверждений нет ни от одного крупного поисковика. Google публично говорил, что не использует его при обходе. Это не значит, что файл бесполезен: его читают некоторые инструменты и сервисы, работающие поверх моделей. Но рассчитывать на то, что он повлияет на выдачу, оснований нет.

Может ли llms.txt навредить?

Нет. Это обычный текстовый файл, который не влияет ни на индексацию, ни на ранжирование, ни на скорость сайта. Единственный реальный риск — написать в нём неправду или устаревшие цены и получить модель, которая эту неправду цитирует. Поэтому его и стоит генерировать из данных сайта, а не вести отдельно.

Чем llms.txt отличается от llms-full.txt?

Второй вариант формата предполагает, что в файл кладут не ссылки, а сразу весь текст сайта. Для документации это осмысленно, для сайта услуг — почти никогда: получается огромный файл, который дублирует страницы и стареет ещё быстрее.

Нужен ли он маленькому сайту?

Если на сайте десять страниц, модель и так разберётся без подсказки. Полчаса работы всё равно можно потратить — хуже не станет. Но если выбирать, куда вложить эти полчаса, разметка Schema.org и внятный первый абзац на каждой странице дадут больше.

Разобрать это на вашем сайте

Бесплатный разбор: смотрю сайт и карточки и записываю видео на двадцать минут. Если браться не стоит — скажу и это.

Забрать разбор