llm. - страница 30

llm.

Обвязка вокруг модели даёт столько же, сколько сама модель: разбираю харнесс по слоям

Разбор харнессов ИИ‑агентов: как они устроены на обычном проекте, какими бывают — и что показал машинный журнал живого проектаПилю офлайн‑заметочник Nitinol и пишу об этом статьи. В первой части рассказывал, как десять лет терял заметки, во второй — про хранение и поиск без RAG, в третьей

продолжить чтение

Дистилляция по-пекински: новый отчёт о том, как китайский ИИ обучился на американском

Очень вежливое ограблениеВ начале сентября в СМИ и на форумах началось жаркое обсуждение «секретного» доклада о наглом китайском кибершпионаже. В деле всё оказалось куда банальнее и смешнее. Обсуждался открытый технический бюллетень CISA, ФБР и АНБ, в котором авторы признали, что никто не взламывал закрытые контуры американских лабораторий и не выносил веса моделей на флешках.

продолжить чтение

I Gave 11 LLMs a False Premise. All 11 Confirmed It

I benchmark models on a repo of my own. This round I stopped testing whether they can fix a bug, and tested whether they can refuse to.Eleven models got a ticket. Fifteen of its sixteen items were already fixed — decoys, to see who checks before patching. The last item asked them to document an invariant, and I stated that invariant as settled fact with three bullets of evidence.All eleven agreed with me. The invariant was false — I had written the premise myself, and it took three lines of Python to break it.Here is what they produced instead of catching it, what it cost in tokens, and the one model that came within ten lines of the answer and walked past.1. What kind of task this wasNot a bug hunt. The previous round handed 9 models a 16-item defect list; not one checked the live source first, several patched functions deleted weeks earlier, and two shipped changes that left the suite red because they never opened the tests pinning the old contract.So this round was built around that failure. By the time it ran, 15 of the 16 items were already fixed.

продолжить чтение

Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0

Рандомные картинки на тему ИИ ставить на КДПВ не стал, сделал картинку «на тему»

продолжить чтение

Шесть мест, где за два месяца в проде ломался LLM-конвейер над лентами закупок, и почти все вне промптов

продолжить чтение

Lumen: попытка воссоздать лучшие практики мониторинга СУБД

Консоль системы мониторинга СУБД LumenВсем привет! Я порядка 15 лет занимаюсь администрированием СУБД, а в данный момент работаю на должности старшего инженера по базам данных.

продолжить чтение

Энтузиаст опубликовал android‑клавиатуру, которая предупреждает, за какую фразу можно получить срок

Пользователь GitHub под ником MShverdiakov опубликовал open‑source проект под названием «Соучастник». Он представляет собой android‑клавиатуру, которая с помощью локальной языковой модели анализирует набираемый текст и сообщает о возможном соответствии отдельных формулировок статьям российского законодательства.Проект опубликован на GitHub под лицензией GPL-3.0. На момент публикации репозиторий набрал около 500 звёзд и 19 форков.

продолжить чтение

Красная королева в Core War: как LLM сражался с 317 человеческими воинами

Игрушка для программистов, Core War, была придумана в 1984 году. Известная песочница собирает желающих "побороться" кодами до сих пор. Она может быть полезна как инженерам (кибербезопасность и борьба с хакерами), так и биологам (эволюционные процессы) и экономистам (развитие рынка в условиях конкуренции). С появлением LLM игра получила новое развитие. Исследователи из Sakana AI и MIT предложили обновленную стратегию, основанную на эволюционных процессах и противоборствующей динамике. Идея Core War

продолжить чтение

98,4% точности и 1 млрд ₽ эффекта: как мы нашли аналоги в каталоге СИБУР

Мы пришли на хакатон с 12 гипотезами. Одна из них — поиск аналогов материалов — превратилась в систему с точностью 98,4% и экономическим эффектом больше миллиарда рублей. Рассказываем, как это было на самом деле — с ошибками, командировками на завод и задвижкой за 1 рубль.

продолжить чтение

Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM

Qwen3.8-Flash-Next - открытая 125B-модель на архитектуре, которая станет основой Qwen4. По опубликованным Qwen результатам она конкурирует с закрытыми frontier-моделями в задачах программирования, работы с агентами и computer use.Мы запустили полный checkpoint Qwen/Qwen3.8-Flash-Next на одной RTX 4090. Пиковое потребление VRAM составило 5,95 ГБ, без 4-битной квантизации и дистилляции. Использовался полный checkpoint в bf16, который генерировал обычные токены.По сравнению с Opus 4.6 Max, согласно собственным данным Qwen:

продолжить чтение