Почему бенчмарки в AI сломались — и что с этим делать в понедельник
В январе 2026 года Янн Лекун, уходя из Meta, сказал в интервью Financial Times про релиз Llama 4: «The results were fudged a little bit» (Fast Company, 6 января 2026). Команда показывала на LMArena одну версию модели, в продакшен ушла другая. На бенчмарке всё было правильно. В реальности код был хуже DeepSeek V3.Я хочу разобрать эту историю. Не потому что Meta — исключение. Потому что они — симптом.TL;DR.
Без документации ИИ далеко не уедет: мои грабли на проекте
Это продолжение статьи "ИИ может писать код, но умеет ли он делать красиво? Мой опыт с виджетом и аватарами".На этой неделе я побывал в телеграм-клубе AI Practiq, где ребята собираются, обсуждают вайбкодинг, делятся опытом и практиками.Один из участников рассказывал о своём опыте и выделил четыре важных аспекта качественной разработки с ИИ. Один из них - документация.Это очень точно совпало с моими ощущениями.ИИ не должен работать по принципу First Code.
Я держу 4 Claude-инструмента в работе. HBR говорит, что у таких brain fry. Я был среди них
После моей статьи про Lexis (AI-репетитор на 4 LLM-провайдерах) у меня стали спрашивать: Как ты не выгорел?. Я отвечал так: 4 провайдера - это для пользователей, для разработки я использую Claude.Месяц спустя я перечитал свой ответ и понял, что он наполовину правда. На разработку я тоже использую четыре инструмента: Claude Code (для кода), Claude Cowork (для документов и контента), Claude Design (попробовал для лендингов) и обычный chat.claude.ai для быстрых вопросов. Параллельно у меня лежит OpenAI API-ключ для тестов. Сейчас я думаю подключить пятый - Codex в связке с Claude за $40/месяц.
Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?
Ollama и Open WebUI на VPS без GPU: рабочий вариант или боль?
Нейросети-Художники. ChatGPT в этой роли
Нейросети или как их ещё любят называть "Искусственный интеллект" развивается каждый день, каждый час и каждую минуту, обучаясь чему-то новому. Наверное уже каждый смог их попробовать, а кто-то интегрировать их в свои процессы: разработка продуктов, автоматизация бизнес-процессов, написание дипломных работ и очень большой спектр применения. Кто-то боится их, переживает, что "роботы" захватят мир, но пока к этому не стремиться. Тут разберем именно нейросети, которые умеют рисовать, т.е. генерировать картинки, и одной из них будет ChatGPT от OpenAI. ChatGPT
Когда «просто проведи кастдев» — худший совет
Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то
Синтетические интервью работают или как говорить с призраками
Нет клиентов, времени или денег — а стратегия нужна вчера? Бывают ситуации, когда полноценное дискавери просто невозможно. Кейс о том, как я из этого выбрался, и все промпты внутри.Ой-бойцовский клуб, надо ж такое знать-то
Почему классический подход к QA больше не работает (и виновата ли в этом эпоха ИИ)
Я всё чаще замечаю, что разговоры о качестве программного обеспечения как будто застряли в прошлой эпохе. Мы по привычке обсуждаем тест-кейсы, регрессию, покрытие, приёмку перед релизом и автоматизацию проверок, как будто этого по-прежнему достаточно, чтобы уверенно говорить о качестве продукта. Но сама среда, в которой живёт современное ПО, уже давно стала другой.
Легко ли навайбкодить новый «Черный квадрат»?
С того момента, как в 2017 году восемь инженеров из Google разработали концепцию трансформеров, индустрия проходит через все пять стадий принятия по Кюблер-Росс. Было отрицание — когда Google даже не стал это патентовать, был гнев — когда Дарио Амодей с частью команды ушли из OpenAI, торг — когда техногиганты рискнули или не рискнули начать скупать ИИ‑стартапы (ну, предположим). Почти прошла депрессия — от осознания того факта, что нас всех заменит ИИ. В итоге мы как‑то докатываемся до стадии принятия

