llm. - страница 134

llm.

Почему бенчмарки в AI сломались — и что с этим делать в понедельник

В январе 2026 года Янн Лекун, уходя из Meta, сказал в интервью Financial Times про релиз Llama 4: «The results were fudged a little bit» (Fast Company, 6 января 2026). Команда показывала на LMArena одну версию модели, в продакшен ушла другая. На бенчмарке всё было правильно. В реальности код был хуже DeepSeek V3.Я хочу разобрать эту историю. Не потому что Meta — исключение. Потому что они — симптом.TL;DR.

продолжить чтение

Я держу 4 Claude-инструмента в работе. HBR говорит, что у таких brain fry. Я был среди них

После моей статьи про Lexis (AI-репетитор на 4 LLM-провайдерах) у меня стали спрашивать: Как ты не выгорел?. Я отвечал так: 4 провайдера - это для пользователей, для разработки я использую Claude.Месяц спустя я перечитал свой ответ и понял, что он наполовину правда. На разработку я тоже использую четыре инструмента: Claude Code (для кода), Claude Cowork (для документов и контента), Claude Design (попробовал для лендингов) и обычный chat.claude.ai для быстрых вопросов. Параллельно у меня лежит OpenAI API-ключ для тестов. Сейчас я думаю подключить пятый - Codex в связке с Claude за $40/месяц.

продолжить чтение

Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?

Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?

продолжить чтение

Когда «просто проведи кастдев» — худший совет

Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то

продолжить чтение

Синтетические интервью работают или как говорить с призраками

Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то

продолжить чтение

Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM.Часть 3.Дистилляция

С чего всё началось

продолжить чтение

Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM. Часть 2. Обучение

Продолжаем серию про файнтюнинг и создание DevOps‑агента Oni. В прошлой части

продолжить чтение

Локальные LLM в реальной работе: Gemma 4, Qwen 3.6 и Qwen Coder

Gemma 4 обыграла Qwen Coder в задачах программирования, а режим мышления заставил модели хуже следовать инструкциям. Рассказываю почему.Зачем я это затеялПривет, меня зовут Вячеслав. Я интересуюсь локальными LLM и тем, как они ведут себя в реальных задачах — не на синтетических бенчмарках, а когда нужно написать работающий код, отрефакторить файл с багами или вытащить данные из HTML.

продолжить чтение

Агрегатор LLM, как выбирать живые free-модели и переживать сбои провайдера

Если в проекте появляется выбор LLM, почти сразу возникает соблазн сделать это как можно проще. Взять один большой список моделей, показать его в интерфейсе, выбрать первую free-модель по умолчанию и считать задачу закрытой. На короткой дистанции это выглядит рабочим вариантом. На длинной начинает ломаться сразу в нескольких местах.

продолжить чтение

NPU в ноутбуках: что меняется для тех, кто закупает корпоративную технику

продолжить чтение