Скрытая структура генерации текста ИИ. Как контекст меняет продолжение
Иногда нескольких слов достаточно, чтобы довольно точно предположить, что будет дальше. В других случаях для этого требуется больше информации.
От разовых запросов к повторно используемым ИИ‑флоу в QA
Введение Прежде чем начать, скажу, что эта статья написана для QA‑инженеров, которые только начинают использовать AI в QA‑процессах. Это не глубокое погружение в продвинутое использование Agentic AI или во внутреннюю логику AI‑систем. Автономные AI‑агенты и системы оркестрации сейчас активно обсуждаются, но стоит помнить: sic parvis magna. Так что добро пожаловать.
Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход
Один пользователь Claude пишет, что потратил больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit стоит воспринимать осторожно, но проблема за ними реальная: длинный контекст обходится дороже, а иногда ещё и мешает модели нормально работать.
Токены в ИИ и оптимизация промптов: как я сэкономила 50% бюджета и перестала здороваться с ChatGPT
Меня зовут Анна, я ведущий инженер по тестированию в Рексофт. Последние два года я плотно работаю с большими языковыми моделями: интегрирую их в CI/CD, использую для генерации тестов и анализа логов. И довольно быстро столкнулась с жестокой реальностью: недельный лимит токенов на проекте — всего 10 000, а один мой вежливый запрос с «пожалуйста» съедал почти 500 токенов на входе и еще пару тысяч на выходе.
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст.Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией.
Контекстное окно: почему нейросеть забывает части разговора
Представьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи фактов, которые он непринужденно рассказывает, он не может ничего запомнить. Ваш диалог с ним каждый раз как бы начинается заново. Вы даете ему вводные, задаете вопросы, что-то уточняете, а он, на основе всего этого, выдает ответ.
Что такое контекстное окно и почему модели забывают
Ты час разговариваешь с ChatGPT. Даёшь контекст, объясняешь задачу, уточняешь детали. А потом модель вдруг начинает противоречить тому, что говорила раньше. Забывает имя персонажа которое ты указал в самом начале. Спрашивает то, о чём вы уже договорились.Первая реакция - что-то сломалось. Но это не баг. Это фундаментальное ограничение архитектуры, у которого есть название и объяснение.Модель не помнит - она читаетГлавное заблуждение про языковые модели - что у них есть память. Что где-то внутри хранится история ваших разговоров, и модель к ней обращается.Это не так.
LLM написала, человек одобрил, никто не понял: откуда на самом деле берётся нечитаемый код
«Она написала мне идеальную документацию. Триста страниц. Теперь я не понимаю не только код, но и документацию»1. Знакомое ощущениеКод работает. Тесты проходят. А читать его невозможно. «Я бы написал это иначе» — думает каждый, кто открывал результат работы LLM-агента. Или другая сторона той же монеты: модель выдала исчерпывающий документ, в нём есть всё — а в голове после прочтения не остаётся ничего.Мы привычно называем это «низким качеством». Плохо обучили. Недотюнили. Промпт кривой. Но давайте присмотримся: качество ли это?

