Токены в ИИ и оптимизация промптов: как я сэкономила 50% бюджета и перестала здороваться с ChatGPT
Меня зовут Анна, я ведущий инженер по тестированию в Рексофт. Последние два года я плотно работаю с большими языковыми моделями: интегрирую их в CI/CD, использую для генерации тестов и анализа логов. И довольно быстро столкнулась с жестокой реальностью: недельный лимит токенов на проекте — всего 10 000, а один мой вежливый запрос с «пожалуйста» съедал почти 500 токенов на входе и еще пару тысяч на выходе.
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст.Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией.
Контекстное окно: почему нейросеть забывает части разговора
Представьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи фактов, которые он непринужденно рассказывает, он не может ничего запомнить. Ваш диалог с ним каждый раз как бы начинается заново. Вы даете ему вводные, задаете вопросы, что-то уточняете, а он, на основе всего этого, выдает ответ.
Что такое контекстное окно и почему модели забывают
Ты час разговариваешь с ChatGPT. Даёшь контекст, объясняешь задачу, уточняешь детали. А потом модель вдруг начинает противоречить тому, что говорила раньше. Забывает имя персонажа которое ты указал в самом начале. Спрашивает то, о чём вы уже договорились.Первая реакция - что-то сломалось. Но это не баг. Это фундаментальное ограничение архитектуры, у которого есть название и объяснение.Модель не помнит - она читаетГлавное заблуждение про языковые модели - что у них есть память. Что где-то внутри хранится история ваших разговоров, и модель к ней обращается.Это не так.
LLM написала, человек одобрил, никто не понял: откуда на самом деле берётся нечитаемый код
«Она написала мне идеальную документацию. Триста страниц. Теперь я не понимаю не только код, но и документацию»1. Знакомое ощущениеКод работает. Тесты проходят. А читать его невозможно. «Я бы написал это иначе» — думает каждый, кто открывал результат работы LLM-агента. Или другая сторона той же монеты: модель выдала исчерпывающий документ, в нём есть всё — а в голове после прочтения не остаётся ничего.Мы привычно называем это «низким качеством». Плохо обучили. Недотюнили. Промпт кривой. Но давайте присмотримся: качество ли это?
Harness под любую задачу: Dynamic Workflow в Claude Code
На прошлой неделе мы выпустили динамические воркфлоу в Claude Code. Теперь Claude может на лету писать собственную обвязку (harness) под конкретную задачу.Стандартная обвязка Claude Code создавалась для кода — но она также полезна для многих других типов задач, поскольку, как выясняется, многие задачи напоминают задачи по написанию кода. Тем не менее есть определённые классы задач, под которые нам приходилось строить кастомные обвязки поверх Claude Code для достижения максимальной производительности:
Представлена языковая модель с линейной сложностью вычислений и контекстом до 12 млн токенов
Кратко: стартап Subquadratic представил SubQ 1M-Preview — первую языковую модель с линейной сложностью вычислений относительно длины контекста. Заявлены контекст до 12 млн токенов, скорость в 52 раза выше FlashAttention и радикальное снижение стоимости. Независимых тестов пока нет (хотя стартап заявляет о сторонней верификации своих бенчмарков), доступ закрыт. Техническое сообщество реагирует сдержанно: пока это амбициозный пресс-релиз, а не готовый инструмент.

