opus.

Как устроена Kimi K3: 2,8 трлн параметров, линейное внимание и агенты на миллион токенов

я устал сжимать оригинальное видео с >1mb gifMoonshot AI выпустила веса Kimi K3

продолжить чтение

LLM против APK: сколько стоит автономно перепаковать Android-приложение

продолжить чтение

Первые впечатления о Grok 4.5 и ChatGPT 5.6 — Sol, Terra, Luna

Grok 4.5Про Грок 4.5 все понятно из картинки. Впечатления как и об остальных Гроках - печаль, тоска и надеюсь это чудо в перьях не заменит Composer в Cursor.

продолжить чтение

Почему у тебя не получится завайбкодить игру за час? Рассказываю на своем опыте

Всем привет! Меня зовут Саша, и я ML‑инженер. Современная разработка ML‑пайплайнов это уже давно не только обучение моделей. Хороший ML‑инженер, помимо всего прочего, пишет backend‑сервисы, настраивает Docker, занимается деплоем моделей, и иногда даже пишет автотесты для своих решений. Поэтому за время своей работы я успел в той или иной степени столкнуться с задачами разных направлений разработки в айтишке. В связи с этим у меня возник резонный вопрос:Смогу ли я сделать что‑то прикольное и полезное в отрасли, максимально далекой от меня?Геймдев — как раз отличный вариант.

продолжить чтение

Anthropic Economic Index: автономность Claude Code, опрос пользователей и новая методология

Anthropic опубликовала шестой выпуск Economic Index, в котором компания не только обновила методологию сбора данных, но и впервые провела масштабный опрос пользователей. Главный вывод, который переворачивает представление о том, как мы взаимодействуем с ИИ: на уровень автономии влияет не столько модель, сколько интерфейс и среда выполнения задачи.Что изменилось в методологииРанее компания полагалась на семидневные срезы данных. В новом отчёте выборка стала ежечасной

продолжить чтение

Упс, они сделали это снова? Почему ваш ИИ тупеет ровно перед выходом новой модели

Ничего криминального, просто плановое обслуживание

продолжить чтение

Как измеряют LLM: параметры, бенчмарки и тесты на коленке

В комментариях к моей предыдущей статье о тестировании трех флагманских LLM моделей были примерно такие мысли и вопросы:Я взял простую бесплатную LLM, запустил локально и она тоже справилась.А почему вы в свое сравнение не взяли никого от DeepSeek, они же тоже хороши?А зачем всем один и тот же промпт, они же по-разному их воспринимают?

продолжить чтение

GigaChat vs Opus в агентском аудите файрвола: попытка сравнения

Взяли один агент, один навык и одну выгрузку правил Ideco NGFW – и прогнали её через GigaChat Max и Claude Opus 4.8. Рассказываем, что из этого получилось, почему «настоящего» агентского теста не вышло и сколько всё это стоило в токенах и рублях.Зачем мы это затеялиВ прошлой статье – «Пещера Аладдина для безопасника»

продолжить чтение

Привет, кожаные мешки

Промпт меняет не только тон — он меняет то, кем модель является.

продолжить чтение

Я выпустил нейросеть в реальный мир — и стало не смешно

Промпт меняет не только тон — он меняет то, кем модель является.

продолжить чтение

12