llm.
ИИ на службе у ФНС: как КНП идет к эпохе «автоактов»
На днях встретился с бывшими коллегами-налоговиками, которые, как и я, недавно ушли со службы. Обсудили то, что сейчас происходит в ФНС, региональных инспекциях, как в целом себя ощущает бизнес. И по нашему мнению пока на ПМЭФ заявляют, что с налоговой нагрузкой все в порядке и палку никто не перегнул, на самом деле все гораздо менее радужно, а то будущее которое нам готовит, грозит и вовсе «похоронить» малый и средний бизнес.
LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU
АннотацияАвтоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных малых языковых моделей (small language models, SLM). Транскрипт лекции продолжительностью ≈1,5 ч составляет около 15–20 тыс. токенов и формально умещается в контекстное окно современных локальных SLM, однако при обработке такого контекста single-call SLM систематически деградируют: теряют фрагменты из середины последовательности, не удерживают структуру и галлюцинируют термины и формулы. Это проявление эффекта Lost in the Middle
Сравниваем LLM: 11 тестов для Opus 4.8, GPT 5.5 и Gemini 3.1 Pro
Меньше месяца назад Anthropic выпустила модель Claude Opus 4.8. Как обычно, заявили много новых плюшек, вроде улучшенного кодинга и режима Fast Mode. Нам это показалось отличным поводом, чтобы устроить ее сравнение с двумя другими тяжеловесами рынка от Google и OpenAI.
AI Hardcore Set: MCP, агенты и безопасность GenAI — офлайн-встреча в Авито
11 июля в московском офисе Авито (Лесная, 7) пройдёт AI Hardcore Set — встреча для тех, кто уже работает с MCP и агентами в проде, а не только читает об этом.Четыре доклада без записи — про Spec-Driven Development, разработку и тестирование MCP для аналитических агентов, дизайн инструментов, которые модели понимают правильно, и практическую безопасность агентов по OWASP. После докладов — «Своя игра» и нетворкинг на террасе до 18:00.Основная программа: 12:00–15:30. Места ограничены, нужна регистрация. Не забудьте паспорт — он потребуется на входе.→
Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения
Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И сценарий почти всегда повторяется: команда быстро собирает прототип на внешнем API, выкатывает его в продакшен, продукт начинает приносить ценность, а вместе с ценностью приходит и тревога. Работает ли всё так, как мы ожидали? В этот момент хочется уже не угадывать, а измерять.Эта статья про то, как измерять. Точнее, про то, как тестировать и мониторить адаптивные LLM-системы в продакшене и до него, чтобы убедиться: ассистент ведёт себя так, как задумано.Что именно мы оцениваем
Что перестаёт работать в тестировании, когда приходит LLM
Слева — привычный зелёный тест. Справа — то, что с ним делает LLM

