
Большой отчёт можно целиком передать языковой модели, если он помещается в контекстное окно. Но техническая возможность принять текст не означает, что модель одинаково точно учтёт каждую страницу.
Что такое контекстное окно
Контекстное окно содержит запрос, приложенные материалы, историю диалога и место для ответа. Его размер измеряют в токенах. Токен может быть словом, частью слова или знаком пунктуации.
Для русского текста грубая оценка составляет один токен на четыре или пять символов. Точное число зависит от токенизатора модели. Документ на сто страниц может занять от 50 до 60 тысяч токенов, но таблицы, код и разметка изменят результат.
Заявленный размер и рабочая точность
Производители предлагают модели с окнами от десятков тысяч до нескольких миллионов токенов. Спецификации быстро меняются, поэтому перед проектированием нужно проверить документацию выбранной модели и отдельные ограничения веб-чата и API.
Большое окно решает проблему вместимости. Оно не гарантирует точное извлечение факта. Модели часто лучше учитывают начало и конец длинного ввода, а сведения из середины пропускают. Этот эффект называют lost in the middle.
Длинный контекст также увеличивает KV-кэш, задержку и стоимость запроса. Добавление лишних документов может ухудшить ответ, потому что модель получает больше похожих и противоречивых фрагментов.
Как работать с большими документами
- Считайте токены до отправки запроса.
- Делите материал по смысловым разделам, а не по случайному числу символов.
- Сохраняйте промежуточные выводы и ссылки на страницы.
- Оставляйте место для ответа и служебных инструкций.
- Проверяйте важные факты отдельным запросом к исходному фрагменту.
- Тестируйте вопросы, ответ на которые находится в начале, середине и конце документа.
Когда выбрать RAG
RAG индексирует документы и передаёт модели только фрагменты, подходящие к вопросу. Он полезен, если документов много, база регулярно обновляется или пользователю нужны ссылки на источники.
RAG тоже может ошибиться. Поиск иногда пропускает нужный фрагмент, поэтому его качество проверяют отдельно от текста ответа.
Для одного большого документа подойдёт разбиение на части с последовательным анализом. Для постоянной базы и множества вопросов чаще удобнее RAG. В обоих случаях размер окна остаётся техническим пределом, а не показателем качества.

