llm. - страница 21

llm.

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max). При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

продолжить чтение

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

продолжить чтение

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Дисклеймер. Я держу сервис аренды маков, у меня флот одинаковых Mac mini и повод их гонять. Первые машины на M6 и M5 Pro у нас появятся вскоре после старта продаж, тогда выйдет вторая часть с реальными замерами. Единственная ссылка в тексте ведёт на страницу с данными, они открыты.Зачем прогноз, если можно подождать замерЧерез несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Первую неделю все будут спрашивать одно и то же, сколько это железо выдаёт на локальных моделях, а ответов не будет ни у кого, потому что машины только доехали.

продолжить чтение

Как проверяющий ИИ испортил правильные ответы: разбор генератора учебных заданий

В задании на сортировку было слово «маши…ый». Генератор положил его в корзину «Две НН», и это верно. Проверка переложила слово в корзину «Одна Н». Вот ответ модели-арбитра, после которого это случилось, без правок, из сохранённого JSON:{ "n": 4, "a": "Одна Н", "why": "Прилагательное от «машина» с суффиксом -н-: корень оканчивается на н? Нет — «машин-» + -н- даёт «машинный»? В школьной норме пишется «машинный» (две НН), но по данному заданию основа «машин»+н… — фактически верно «машинный»." } Ответ в поле a неверный, а в объяснении модель сама приходит к «машинный». Код читал только a.

продолжить чтение

Не только PyTorch. О чём на самом деле новая книга Лоуренса Морони

Название новой книги Лоуренса Морони — «

продолжить чтение

Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье

продолжить чтение

Империя терминаторов: как двести агентов построили цивилизацию

продолжить чтение

Сколько стоит месяц с AI-агентом: API против подписок

В августе 2026 я показывал своим коллегам на митапе таблицу с месячной стоимостью работы через разные модели. Через месяц открыл её снова — половина цифр уже устарела. DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Пришлось пересчитать всё заново по ценам на 16 сентября и заодно разобраться, что выгоднее: платить за API или покупать подписки.Что я считал

продолжить чтение

Power Automate + LLM API: автоматизация протоколов совещаний из Teams транскриптов (с помощью Claude)

TL;DR: Хотел полную автоматизацию "встреча → протокол в канале Teams". Получил полуавтоматику с ручным шагом в 30 секунд. Сэкономил 20-30 минут на каждую встречу за $0.33 в месяц. Разбираю что сработало, где упёрся в ограничения Microsoft, и стоила ли игра свеч. Весь проект — от идеи до работающего flow — собран в диалоге с Claude.ПроблемаЯ delivery-менеджер, веду несколько команд. После каждой встречи нужен протокол: кто был, что обсудили, кто что делает.Раньше это выглядело так:Делаю заметки во время встречи

продолжить чтение

Промпт не удержал медицинскую границу. Как мы добавили LLM-тренеру страж на регулярках

В 1trAIner ИИ-тренер отвечает спортсменам в чате, пишет планы и разбирает тренировки. Сервис информационный: диагнозов не ставит. В системном промпте с самого начала было правило «при боли и травме — к врачу». Мы считали вопрос закрытым, пока не начали проверять ответы на трёх языках.Ниже — как мы нашли дефект, почему промпт его не лечит и что сделали кодом. С цифрами, в том числе неудобными.Как нашли

продолжить чтение

1...10...192021222324...3040...366