3. Bonsai-27B на рекурсивном форке llama.cpp: полный запуск и реальный бенчмарк на RTX 3050
Всем привет! Это третья часть про мой форк llama.cpp. В прошлых статьях я показывал, как работает рекуррентность и какие цифры она даёт на обычных моделях. Сегодня — особенное железо: Bonsai-27B, гибридная модель на линейной архитектуре Delta-Net. Расскажу, как её запустить на слабой видеокарте, и главное — покажу реальный замеренный бенчмарк D=0 против D=12 на сложной задаче, которую базовая модель не смогла решить вообще.Все цифры ниже получены на моём железе вживую. Никакой магии и отрисованных «в пользу» диаграмм.0. Что такое Bonsai-27B и почему он особенный
Anthropic заявила о взломе систем трёх компаний со стороны Claude в тестах
Компания Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.
Я собрал кнопку, которая сотрёт прогресс всех моих игроков. И до сих пор боюсь её нажать
Одинокий выживший держит руку у красного рубильника в пыльном бункере
DeepSeek V4: Обзор нейросети, бенчмарки и тесты
Нейросети не стоят на месте и постоянно развиваются. Так, 23 апреля мир увидел ChatGPT 5.5. Но лично я с большим нетерпением ждал именно DeepSeek V4. Сколько времени прошло с того момента, как появились первые слухи о будущем релизе от китайской компании? Предыдущая версия запомнилась мне хорошим показателем в повседневных задачах и, что немаловажно, полной бесплатностью.
Код без автора
Открыл MR на ревью. 847 строк. Тесты зелёные. Линтер чистый. Покрытие 91%.Одобрил.Через два дня - баг на проде. Webhook от платёжки возвращал 500 на определённой комбинации параметров. Полез разбираться. Смотрю в код и понимаю: я не помню, почему тут именно такая логика. Открыл git blame. Коммит мой. Ну, формально мой - Claude написал, я замержил.Самое неприятное - я этот код одобрил не потому, что разобрался. А потому, что он выглядел нормально. Тесты прошли. Линтер не ругался. Я решил, что этого достаточно. Не было.211 миллионов строкGitClear проанализировали
Компании перешли от простого внедрения ИИ к оценке понимания этих инструментов сотрудниками
Согласно данным платформы бизнес-аналитики AlphaSense, за последние 90 дней руководители компаний как минимум 60 раз упоминали «первопроходцев в освоении ИИ» в ходе конференций, презентаций, выступлений и других подготовленных речей. Теперь некоторые из крупнейших американских компаний переходят от простого внедрения искусственного интеллекта к оценке того, насколько хорошо их сотрудники действительно понимают технологию.
Ваш IQ в жизни намного меньше чем в тесте
Средний IQ по миру ровно 100, но когда вы проходили тест у вас было 110-120 или больше. Получается, вы умнее чем средний человек на земле? Нет.В реальности у вас на 10-20 баллов меньше, вы как раз на уровне среднего человека.Почему средний человек 100 лет назад имел 80 IQ, но не проиграл бы нам по интеллекту?Почему тесты завышают результаты IQ, и влияют ли эти тесты на интеллект и успех в жизни
Ваша работа — выпускать код, который доказанно работает
Во всех обсуждениях ценности ИИ-помощников в разработке ПО мне встречается одна печальная история: разработчик-джун, вооружившийся каким-нибудь LLM-инструментом, создаёт для своих коллег или мейнтейнеров опенсорс-проекта огромный нетестированный PR, ожидая, что всё остальное решится благодаря процессу код-ревью.Такое поведение грубо, оно заставляет других людей впустую тратить время и идёт вразрез с долгом разработчика ПО.Ваша задача — выпускать код, который доказанно работает.Мы, разработчики ПО, не просто производим код; сегодня даже можно сказать, что для этого предназначены LLM. Мы должны выпускать

