llm. - страница 27

llm.

LLM против APK: сколько стоит автономно перепаковать Android-приложение

продолжить чтение

Разрушители мИИфов – тестируем Headroom. Правда ли умная прокся может сэкономить вам токены?

Признаю: в прошлой статье про тестирование Caveman я в конце написал, что такие инструменты, как RTK, действительно, могут помочь сэкономить токены. Я доверял самому принципу возможности экономии токенов, но не доверял конкретным цифрам эффективности, которые заявляет Headroom. Был уверен, что, садясь за тесты, скорее всего, увижу, не 60–95% экономии токенов, а типа 10% — или что-то такое. Но результат меня удивил в худшую сторону. Итак, тестируем Headroom вместе:Как Headroom работает

продолжить чтение

Как я добавил LLM в чат друзей, и приказал ей отыгрывать терминатора (и открыл портал в мультивселенную безумия)

продолжить чтение

120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах

Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.

продолжить чтение

Giga4DQM: мультиагентный подход к расследованию качества данных на базе GigaChat

продолжить чтение

У ИИ есть душа? Даём LLM характер и эмоции

Если вы когда‑нибудь общались с популярными чат‑ботами или заглядывали на Character.ai, легко поддаться иллюзии, будто на той стороне экрана сидит живой человек. ИИ шутит, сопереживает, злится и подыгрывает. Ведёт себя почти как человек. Но может ли за всем этим скрываться настоящее сознание и душа?Ответим вам прямо — за экраном только пустота и холодные математические расчеты.Любая современная языковая модель представляет собой сложный калькулятор статистики, который предсказывает следующее, наиболее вероятное и приятное вам слово. Но не более того.

продолжить чтение

89% моих трат на AI‑агентов — это кэш, а не генерация. Написал CLI, чтобы увидеть

Я много работаю с кодинг‑агентами в Claude Code. В какой‑то момент поймал себя на том, что не представляю, на что уходят токены. Счёт в конце месяца есть, а из чего он складывается, непонятно. Написал небольшую утилиту, которая читает то, что Claude Code и так пишет на диск, и раскладывает расходы по статьям. То, что она показала, мне не понравилось.Вывод ledgent report ‑redact

продолжить чтение

Как OpenRouter Fusion обошёл Claude Fable 5

С начала этого года я веду бенчмарк ИИ моделей для менеджеров, и после последнего обновления – есть о чем рассказать (прошла версия рейтинга тут). Первое место занял OpenRouter Fusion – оркестратор, который вызывает сразу несколько моделей, собирает их ответы и синтезирует финальный результат. Он обошёл всех: и Claude, и GPT, и Gemini поодиночке.

продолжить чтение

Как я готовился к сертификации по LLMархитектуре и понял, что три года путал промпты с архитектурой

Мок-экзамен, вопрос номер сорок с чем-то. Сценарий: система должна классифицировать входящие обращения, и ни при каких условиях категория не может выходить за пределы фиксированного списка. Какой вариант обеспечивает это требование? Я уверенно тыкаю в ответ с формулировкой «добавить в системный промпт строгую инструкцию с перечнем допустимых категорий и явным запретом на другие значения».

продолжить чтение

Вы не внедрили AI. Вы завели кладбище промптов

От личных промптов к командному процессуЯ технический лидер нескольких команд. В этих командах есть разные экспертизы: frontend, backend на NestJS и NextJS, QA, исследовательская работа. Поэтому проблема с LLM-наработками шире, чем "как мне самому писать код быстрее", а "как опыт и навыки одного человека превратить в автоматизированный процесс для команды или компании".

продолжить чтение