opus.
Как устроена Kimi K3: 2,8 трлн параметров, линейное внимание и агенты на миллион токенов
я устал сжимать оригинальное видео с >1mb gifMoonshot AI выпустила веса Kimi K3
Первые впечатления о Grok 4.5 и ChatGPT 5.6 — Sol, Terra, Luna
Grok 4.5Про Грок 4.5 все понятно из картинки. Впечатления как и об остальных Гроках - печаль, тоска и надеюсь это чудо в перьях не заменит Composer в Cursor.
Почему у тебя не получится завайбкодить игру за час? Рассказываю на своем опыте
Всем привет! Меня зовут Саша, и я ML‑инженер. Современная разработка ML‑пайплайнов это уже давно не только обучение моделей. Хороший ML‑инженер, помимо всего прочего, пишет backend‑сервисы, настраивает Docker, занимается деплоем моделей, и иногда даже пишет автотесты для своих решений. Поэтому за время своей работы я успел в той или иной степени столкнуться с задачами разных направлений разработки в айтишке. В связи с этим у меня возник резонный вопрос:Смогу ли я сделать что‑то прикольное и полезное в отрасли, максимально далекой от меня?Геймдев — как раз отличный вариант.
Anthropic Economic Index: автономность Claude Code, опрос пользователей и новая методология
Anthropic опубликовала шестой выпуск Economic Index, в котором компания не только обновила методологию сбора данных, но и впервые провела масштабный опрос пользователей. Главный вывод, который переворачивает представление о том, как мы взаимодействуем с ИИ: на уровень автономии влияет не столько модель, сколько интерфейс и среда выполнения задачи.Что изменилось в методологииРанее компания полагалась на семидневные срезы данных. В новом отчёте выборка стала ежечасной
Упс, они сделали это снова? Почему ваш ИИ тупеет ровно перед выходом новой модели
Ничего криминального, просто плановое обслуживание
Как измеряют LLM: параметры, бенчмарки и тесты на коленке
В комментариях к моей предыдущей статье о тестировании трех флагманских LLM моделей были примерно такие мысли и вопросы:Я взял простую бесплатную LLM, запустил локально и она тоже справилась.А почему вы в свое сравнение не взяли никого от DeepSeek, они же тоже хороши?А зачем всем один и тот же промпт, они же по-разному их воспринимают?
GigaChat vs Opus в агентском аудите файрвола: попытка сравнения
Взяли один агент, один навык и одну выгрузку правил Ideco NGFW – и прогнали её через GigaChat Max и Claude Opus 4.8. Рассказываем, что из этого получилось, почему «настоящего» агентского теста не вышло и сколько всё это стоило в токенах и рублях.Зачем мы это затеялиВ прошлой статье – «Пещера Аладдина для безопасника»
Привет, кожаные мешки
Промпт меняет не только тон — он меняет то, кем модель является.
Я выпустил нейросеть в реальный мир — и стало не смешно
Промпт меняет не только тон — он меняет то, кем модель является.

