llm. - страница 29

llm.

QuantCode-Bench: умеют ли LLM генерировать исполняемые алгоритмические торговые стратегии

Большие языковые модели уже показывают высокие результаты в задачах программирования общего назначения. Они умеют генерировать код, исправлять ошибки, работать с существующими репозиториями и решать задачи, для которых ещё несколько лет назад требовалось непосредственное участие разработчика.Однако в прикладных областях одной синтаксической корректности недостаточно. Модель должна не только написать валидный код, но и правильно интерпретировать предметную постановку, использовать специализированный API и обеспечить требуемое поведение программы при исполнении.

продолжить чтение

52 открытых урока второй половины июля: LLM, C++, Playwright, Kubernetes, TOGAF и не только

Привет, хабровчане! Собрали открытые уроки второй половины июля по ключевым ИТ‑направлениям: от LLM, RAG и Claude Code до C++, Java, Go, Playwright, Kubernetes, сетей ЦОД, TOGAF и тестирования.Уроки проходят онлайн и бесплатны для участников. Можно выбрать одну тему, посмотреть, как преподаватель разбирает практическую задачу, задать вопросы и заодно понять, подходит ли вам формат обучения в OTUS.⬇️ Выбрать свое направлениеAI и ML Разработка Инфраструктура, DevOps и сети Архитектура и enterprise‑системы

продолжить чтение

LLM и уровень усилий (effort) в Claude Code: знать больше или стараться лучше?

Claude Code даёт две настройки, которые обе как бы «улучшают ответ»: модель и уровень усилий (effort). Но как они влияют на результат? И как понять, когда нужно менять модель, а когда — просто уровень усилий?Легко предположить, что модель побольше, например Fable, даёт результат лучше, чем Sonnet, а более высокий уровень усилий значит просто «Claude думает дольше перед ответом».Первое предположение верно. Наши крупнейшие модели действительно более способные согласно отраслевым бенчмаркам.

продолжить чтение

ИИ-грамотность, доверие и цена доменной экспертизы

TL;DRИИ-грамотность - это не промпт-инжиниринг: в 91% научных работ ее ядром называют способность критически оценивать результаты ИИ и этические аспекты его применения.Высокая ИИ-грамотность устойчиво связана с меньшей тревожностью, большим доверием и более активным использованием ИИ; возраст и пол роли практически не играют.Большинство шкал ИИ-грамотности построены на самооценке (self-assessment) и частично измеряют уверенность в себе, а не реальные знания; доменную экспертизу как отдельный фактор не учитывает ни одна из них.

продолжить чтение

Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями

«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.

продолжить чтение

Два движка, два разных веба: почему ChatGPT-search и Яндекс-нейропоиск цитируют из 174 доменов только 7 общих

Я гоняю один и тот же пул из 60 промптов через шесть ИИ-движков раз в месяц — это часть мониторинга, который я веду для одной ниши. В какой-то момент решил не просто читать ответы, а посчитать, откуда движки берут источники. Ожидал разную выдачу по одной теме — обычное дело для поисковиков. Получил другое: два практически несвязанных множества доменов. Из 174 уникальных источников за последний срез общих оказалось 7.Расскажу, как я это посчитал, почему дело не в шуме прогона, а в архитектуре, и почему первый вывод оказался не там, где я его искал.Что за данные и почему их вообще можно сравнивать

продолжить чтение

Я запретил Claude говорить «всё работает» без пруфов. Это изменило всё

Пару месяцев назад я попросил агента проверить форму обратной связи после рефакторинга. Через несколько минут получил отчёт: все проверки пройдены, форма работает корректно. Зелёные галочки, уверенный тон.Я тогда только начинал отдавать тестирование агенту, поэтому работал по схеме «доверяй, но проверяй»: следом прошёл форму руками, с открытой вкладкой Network. Снаружи всё честно: валидация зелёная, кнопка активная, тост «Спасибо!» показывается, сервер отвечает 200. А в payload вместо темы обращения уходит строка . Агент проверил всё, кроме того, что реально уходит на сервер.

продолжить чтение

LLM говнокодит не хуже людей. Только быстрее

Полгода назад я начал писать пет-проект практически полностью с помощью LLM-агентов. Первые недели это был чистый дофамин: фичи вылетали за вечер, я успевал за неделю столько, сколько раньше делала небольшая команда. А потом всё начало вязнуть — ровно так же, как вязнет любой проект с говнокодом. Каждая новая фича ломала две старые, агент правил код «на ощупь», а я всё больше времени тратил не на продукт, а на разгребание.

продолжить чтение

Конвейер из 10 агентов без строчки кода: три промпта, 40 минут и прогон при зале

продолжить чтение

Запуск и оптимизация локальной LLM с llama.cpp

Автор статьи - Даниил Г., Python-разработчикВступление

продолжить чтение