Строительство Aug 14, 2026 at 18:599В закладки

Качественный контекст — это новая задержка, и большинство команд слишком сильно фокусируются на размере окна, а не на плотности сигналов.
Простыми словами: Большие контекстные окна не автоматически означают лучшие результаты работы ИИ. Инженеры, добивающиеся успеха с большими языковыми моделями в продакшене, тщательно отбирают, что попадает в контекст, — а не просто загружают всё подряд.
Барух Садогурский и Патрик Дебуа в своей презентации на InfoQ (14 августа) приводят доводы: извлечённые данные, память и результаты работы инструментов, попадающие в контекстное окно, часто избыточны, противоречивы или попросту нерелевантны. Токен-бюджеты ограничены как во времени, так и в стоимости, а не только в лимитах API — зашумленный контекст ухудшает качество рассуждений и увеличивает задержку. Альтернатива заключается не в использовании меньшей модели, а в более умной её интеграции.
Их архитектурное решение: рассматривать контекст как ресурс, который нужно управлять, а не как буфер, который нужно заполнить. Это означает продуманные стратегии извлечения (гибридный поиск с плотными и разреженными данными, а не только семантическая схожесть), структурированное форматирование вместо сырых текстовых дампов, явное сжатие устаревшего контекста и — что критически важно — анализ того, что модель не должна знать для текущего шага. Они также предлагают практические шаблоны: лениво загружаемые навыки, версионированные артефакты контекста и внешние хранилища памяти как конкретные реализации этой дисциплины.
Под капотом: Фраза «300 токенов» намеренно провокационна — суть не в числе, а в дисциплине. На практике: избегайте добавления полных документов, если достаточно цитируемого отрывка; подводите итоги предыдущих шагов, а не воспроизводите их дословно; используйте структурированные слоты (JSON-схемы) для результатов инструментов вместо свободного текста. Каждое из этих действий снижает соотношение сигнал/шум, через которое должна рассуждать модель.
Итог: По мере роста агентных систем — больше инструментов, длинные цепочки, больше извлечённого контекста — эта проблема усугубляется. Команды, работающие с контекстными окнами более 200k токенов, должны проверять, сколько из этого окна действительно выполняет полезную работу, а сколько — шум, к которому они привыкли. Ограничение смещается с вопроса «Можно ли это впихнуть?» к «Стоит ли это добавлять?».
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Doesn’t focusing on signal density just make the problem harder by requiring deeper domain knowledge without guaranteeing consistency? The model still needs to generalize beyond the curated tokens.
Isn’t the shift from window size to signal density just moving the bottleneck upstream though? The hard part is still extracting meaningful signals in the first place.
You’re right-quality cleaning matters, but what if the noise itself contains useful patterns that traditional filters miss?
This makes total sense-better to focus on precision than brute force in prompts. Wonder how many teams even track the signal-to-noise ratio in their inputs.
Seems like a smart take, but I wonder if the real challenge isn’t just picking tokens but making sure the model can actually use them consistently.
Prompt engineering is hard precisely because you're trying to anticipate what the model will latch onto, not just curate tokens. The real bottleneck shifts from size to understanding-how the model interprets the 300 tokens matters more than their count.
But isn’t the real bottleneck often the ability to *define* what those 300 well-chosen tokens should be in the first place? Most systems still rely on trial and error.
That’s fair-but what if we automate the trial and error instead of relying on manual definition?
Can we trust that the
Fair point, but isn’t the bigger issue that we’re still stuck defining "signal density" through human heuristics rather than letting the model filter relevance autonomously?
I’d argue there’s always a tipping point where signal density collides with contextual richness-beyond which adding tokens just muddies the water further.
Harness Ops : post-mortems et bench des agents en prod