BrainTools - Методики для развития мозга - страница 13

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max). При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

продолжить чтение

В Рунити выяснили, как тематические домены растут с развитием нейропоиска

продолжить чтение

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

продолжить чтение

OpenAI пообещали впредь вовремя рассказывать о «бедокурстве» своих нейронок

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.

продолжить чтение

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Дисклеймер. Я держу сервис аренды маков, у меня флот одинаковых Mac mini и повод их гонять. Первые машины на M6 и M5 Pro у нас появятся вскоре после старта продаж, тогда выйдет вторая часть с реальными замерами. Единственная ссылка в тексте ведёт на страницу с данными, они открыты.Зачем прогноз, если можно подождать замерЧерез несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Первую неделю все будут спрашивать одно и то же, сколько это железо выдаёт на локальных моделях, а ответов не будет ни у кого, потому что машины только доехали.

продолжить чтение

Китайская киноиндустрия начала активно осваивать ИИ

Китайские актёры начали разрешать студиям использовать свои аватары в фильмах, чтобы не остаться без заработка. Такие цифровые копии затем используют в видео, полностью сгенерированных нейросетями.

продолжить чтение

Как проверяющий ИИ испортил правильные ответы: разбор генератора учебных заданий

В задании на сортировку было слово «маши…ый». Генератор положил его в корзину «Две НН», и это верно. Проверка переложила слово в корзину «Одна Н». Вот ответ модели-арбитра, после которого это случилось, без правок, из сохранённого JSON:{ "n": 4, "a": "Одна Н", "why": "Прилагательное от «машина» с суффиксом -н-: корень оканчивается на н? Нет — «машин-» + -н- даёт «машинный»? В школьной норме пишется «машинный» (две НН), но по данному заданию основа «машин»+н… — фактически верно «машинный»." } Ответ в поле a неверный, а в объяснении модель сама приходит к «машинный». Код читал только a.

продолжить чтение

Чему меня научили сто ретроспектив: как менеджер меняет работу команды

продолжить чтение

Не только PyTorch. О чём на самом деле новая книга Лоуренса Морони

Название новой книги Лоуренса Морони — «

продолжить чтение

Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье

продолжить чтение