llm.
Почему бенчмарки в AI сломались — и что с этим делать в понедельник
В январе 2026 года Янн Лекун, уходя из Meta, сказал в интервью Financial Times про релиз Llama 4: «The results were fudged a little bit» (Fast Company, 6 января 2026). Команда показывала на LMArena одну версию модели, в продакшен ушла другая. На бенчмарке всё было правильно. В реальности код был хуже DeepSeek V3.Я хочу разобрать эту историю. Не потому что Meta — исключение. Потому что они — симптом.TL;DR.
Я держу 4 Claude-инструмента в работе. HBR говорит, что у таких brain fry. Я был среди них
После моей статьи про Lexis (AI-репетитор на 4 LLM-провайдерах) у меня стали спрашивать: Как ты не выгорел?. Я отвечал так: 4 провайдера - это для пользователей, для разработки я использую Claude.Месяц спустя я перечитал свой ответ и понял, что он наполовину правда. На разработку я тоже использую четыре инструмента: Claude Code (для кода), Claude Cowork (для документов и контента), Claude Design (попробовал для лендингов) и обычный chat.claude.ai для быстрых вопросов. Параллельно у меня лежит OpenAI API-ключ для тестов. Сейчас я думаю подключить пятый - Codex в связке с Claude за $40/месяц.
Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?
Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?
Когда «просто проведи кастдев» — худший совет
Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то
Синтетические интервью работают или как говорить с призраками
Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то
Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM.Часть 3.Дистилляция
С чего всё началось
Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM. Часть 2. Обучение
Продолжаем серию про файнтюнинг и создание DevOps‑агента Oni. В прошлой части
Локальные LLM в реальной работе: Gemma 4, Qwen 3.6 и Qwen Coder
Gemma 4 обыграла Qwen Coder в задачах программирования, а режим мышления заставил модели хуже следовать инструкциям. Рассказываю почему.Зачем я это затеялПривет, меня зовут Вячеслав. Я интересуюсь локальными LLM и тем, как они ведут себя в реальных задачах — не на синтетических бенчмарках, а когда нужно написать работающий код, отрефакторить файл с багами или вытащить данные из HTML.

