llm.
QuantCode-Bench: умеют ли LLM генерировать исполняемые алгоритмические торговые стратегии
Большие языковые модели уже показывают высокие результаты в задачах программирования общего назначения. Они умеют генерировать код, исправлять ошибки, работать с существующими репозиториями и решать задачи, для которых ещё несколько лет назад требовалось непосредственное участие разработчика.Однако в прикладных областях одной синтаксической корректности недостаточно. Модель должна не только написать валидный код, но и правильно интерпретировать предметную постановку, использовать специализированный API и обеспечить требуемое поведение программы при исполнении.
52 открытых урока второй половины июля: LLM, C++, Playwright, Kubernetes, TOGAF и не только
Привет, хабровчане! Собрали открытые уроки второй половины июля по ключевым ИТ‑направлениям: от LLM, RAG и Claude Code до C++, Java, Go, Playwright, Kubernetes, сетей ЦОД, TOGAF и тестирования.Уроки проходят онлайн и бесплатны для участников. Можно выбрать одну тему, посмотреть, как преподаватель разбирает практическую задачу, задать вопросы и заодно понять, подходит ли вам формат обучения в OTUS.⬇️ Выбрать свое направлениеAI и ML Разработка Инфраструктура, DevOps и сети Архитектура и enterprise‑системы
LLM и уровень усилий (effort) в Claude Code: знать больше или стараться лучше?
Claude Code даёт две настройки, которые обе как бы «улучшают ответ»: модель и уровень усилий (effort). Но как они влияют на результат? И как понять, когда нужно менять модель, а когда — просто уровень усилий?Легко предположить, что модель побольше, например Fable, даёт результат лучше, чем Sonnet, а более высокий уровень усилий значит просто «Claude думает дольше перед ответом».Первое предположение верно. Наши крупнейшие модели действительно более способные согласно отраслевым бенчмаркам.
ИИ-грамотность, доверие и цена доменной экспертизы
TL;DRИИ-грамотность - это не промпт-инжиниринг: в 91% научных работ ее ядром называют способность критически оценивать результаты ИИ и этические аспекты его применения.Высокая ИИ-грамотность устойчиво связана с меньшей тревожностью, большим доверием и более активным использованием ИИ; возраст и пол роли практически не играют.Большинство шкал ИИ-грамотности построены на самооценке (self-assessment) и частично измеряют уверенность в себе, а не реальные знания; доменную экспертизу как отдельный фактор не учитывает ни одна из них.
Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями
«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.
Два движка, два разных веба: почему ChatGPT-search и Яндекс-нейропоиск цитируют из 174 доменов только 7 общих
Я гоняю один и тот же пул из 60 промптов через шесть ИИ-движков раз в месяц — это часть мониторинга, который я веду для одной ниши. В какой-то момент решил не просто читать ответы, а посчитать, откуда движки берут источники. Ожидал разную выдачу по одной теме — обычное дело для поисковиков. Получил другое: два практически несвязанных множества доменов. Из 174 уникальных источников за последний срез общих оказалось 7.Расскажу, как я это посчитал, почему дело не в шуме прогона, а в архитектуре, и почему первый вывод оказался не там, где я его искал.Что за данные и почему их вообще можно сравнивать
Я запретил Claude говорить «всё работает» без пруфов. Это изменило всё
Пару месяцев назад я попросил агента проверить форму обратной связи после рефакторинга. Через несколько минут получил отчёт: все проверки пройдены, форма работает корректно. Зелёные галочки, уверенный тон.Я тогда только начинал отдавать тестирование агенту, поэтому работал по схеме «доверяй, но проверяй»: следом прошёл форму руками, с открытой вкладкой Network. Снаружи всё честно: валидация зелёная, кнопка активная, тост «Спасибо!» показывается, сервер отвечает 200. А в payload вместо темы обращения уходит строка . Агент проверил всё, кроме того, что реально уходит на сервер.
LLM говнокодит не хуже людей. Только быстрее
Полгода назад я начал писать пет-проект практически полностью с помощью LLM-агентов. Первые недели это был чистый дофамин: фичи вылетали за вечер, я успевал за неделю столько, сколько раньше делала небольшая команда. А потом всё начало вязнуть — ровно так же, как вязнет любой проект с говнокодом. Каждая новая фича ломала две старые, агент правил код «на ощупь», а я всё больше времени тратил не на продукт, а на разгребание.
Запуск и оптимизация локальной LLM с llama.cpp
Автор статьи - Даниил Г., Python-разработчикВступление

