ai.
Почему агент на самом деле дешевле RAG
Наивная арифметика, которая всех обманываетКлассический RAG-ассистент работает так: пользователь пишет вопрос → эмбеддинг → поиск в векторе → один вызов LLM для синтеза. Одна итерация. Чисто, быстро, дёшево. Если ответ правильный.Проблема в том, что с первой попытки он правильный не всегда. Пользователь переспрашивает: «нет, я имел в виду другое». Ассистент делает второй запрос. Потом третий. К четвёртому переспросу пользователь машет рукой и зовёт живого оператора. Оператор тратит 10–15 минут, находит нужный документ, копирует абзац в чат. Вопрос закрыт. Стоимость вопроса — не 1 вызов LLM, а:
Один MD, четыре платформы: скилл кросспостинга
Аудитория у моего пет-проекта разъехалась по разным площадкам, ибо про машину и стуки в двигателе и подвеске. Пришлось постить на четыре площадки один и тот же материал, и каждый раз руками расставлять подзаголовки, пересобирать списки и перезаливать картинки, ленивое…Ни одна из четырёх не пропускает CSS. Ни инлайновые стили, ни классы, ни шрифты, ни цвета. У каждой площадки есть короткий список тегов, и местами я даже не понимаю логику. В ВК не нашел таблиц, например, или плохо искал.ПлощадкаЧто переживает вставку
Как думает LLM
Почему ChatGPT иногда может ответить мгновенно, а иногда заставляет смотреть на надпись Thinking почти минуту?На первый взгляд кажется, что модель стала умнее и теперь действительно размышляет перед ответом. А раз уж она размышляет, может модель обрела… самосознание? Конечно, это не так, модель не думает в привычном понимании, она строит несколько гипотез, находит и отбрасывает неудачные варианты и предоставляет пользователю ответ. Этот процесс сегодня называют Reasoning.
Как защитить LLM-агентов от gradient-based adversarial attacks-атак: VRF + LoRA подход
Представьте LLM-агента, который читает торговые сигналы из публичных источников, анализирует их и принимает решение покупать/продавать токены. Каждый день он управляет миллионами долларов. Такие агенты встречаются везде: в Discord, Twitter, Telegram, на собственных серверах компаний.Проблема? Как и большинство LLM-систем в production, они работают на открытых моделях - LLaMA, Mistral и т.д.Открытая модель означает одно: атакующий может скачать её веса и локально оптимизировать адверсариальную атаку через градиентный спуск. И самое страшное - найденная атака будет работать на всех инстансах одновременно, независимо от платформы.
За полчаса и 10 рублей — полноценный сайт для загрузки и редактирования скриншотов на вайбкоде. Пошаговая инструкция
Делюсь личным опытом создания проекта с нуля на вайбкоде.Красивый сайт со сверхбыстрой загрузкой и функционалом, которого не найти на ресурсах без авторизации. И всё это — с нуля за полчаса описания банальных пожеланий на русском языке и менее 10 рублей затрат на одном из самых дешёвых ИИ-сервисов. Это реально новый мир.Описываю в деталях по шагам. В том числе — как ИИ банально «тупит» и не может решить указанную задачу, и как это преодолеть. Промпты — в статье.Что сделал
Популярные публикации в Базе знаний Инфостарт за последние 14 дней: о чем важно знать в мире 1С
В сегодняшнем дайджесте мы собрали популярные решения в Базе знаний Инфостарт за последние 14 дней. Сообщество активно скачивает обработки, ставит лайки и комментирует эти публикации.
Shorts Maker v2: как я превратил AI-генератор видео в возобновляемый production pipeline на Python
Привет, Хабр!Некоторое время назад я написал первую версию генератора коротких видео для Shorts, Reels и TikTok. На вход подавалась тема — например, «Сюжет “1984” за одну минуту», — а на выходе получался вертикальный ролик со сценарием, изображениями, анимацией, озвучкой и субтитрами.Первая версия доказала, что идея работает. Но она же показала, что сгенерировать ролик один раз и построить надёжный production pipeline — совершенно разные задачи.

