llm. - страница 128

llm.

Почему 4 сеньёра могут быть эффективнее команды из 15 человек

Есть компании, которые верят в то, что уж лучше много джунов за копейки, чем несколько сеньоров за дорого.Очевидно, мнения могут быть разными, поэтому поделюсь своим опытом: 1. В компании Х у нас было 4 человека, которые ещё до эпохи ChatGPT с нуля за несколько месяцев собрали полноценный AI-стек: — fine-tune собственных LLM на своих датасетах — свой TTS/STT на своих датасетах — генерацию лиц и deepfake — MLOps-инфраструктуру и пайплайны

продолжить чтение

Агент — это не новый пользователь. Это новый посредник. Что медицина знает об этом 100 лет

На этой неделе прочитала свежую статью Кьяры Пеллегрини из NN/g: «AI-агенты теперь тоже пользователи наших интерфейсов». Автор — серьёзный исследователь, статья хорошо аргументирована. У агента есть цели, агент сталкивается с интерфейсом, агент пытается достичь целей через наш дизайн. По функциональному определению — пользователь.Я не согласна с этой рамкой. И думаю, что разница принципиальная.

продолжить чтение

Некорпоративный Хабр: семантический поиск и фильтрация по структурированным полям в браузере (llama.cpp в WebAssembly)

Классический RAG индексирует исходный текст документа, предварительно разбивая на фрагменты. Потом рассчитывает векторное представление фрагментов и сохраняет их векторные представления в базу данных для поиска. Это дает возможность искать по сходству фрагментов текста и поискового запроса пользователя, но не дает возможность искать по более высокоуровневым резюме и смыслам, темам поднятым в тексте и прочему. Также не помогает с аналитикой по содержимому.Бесплатный проект text-metadata-generator позволяет выполнять запросы к LLM по каждому документу из коллекции документов, результаты вывода LLM проверяются по JSON схеме.

продолжить чтение

Vercel выкатил язык программирования для агентов. Я пытаюсь понять, нужен ли он мне

15 мая Vercel Labs релизнули Zero. Экспериментальный системный язык, который сами авторы называют "the programming language for agents". Версия 0.1.1, Apache 2.0, расширение .0, бинарники меньше 10 килобайт, без LLVM. На GitHub лежит компилятор, стандартная библиотека и примеры — можно ставить и щупать прямо сейчас.Я прочитал доки, поставил себе, погонял пару примеров. Сижу с этой мыслью: серьёзно или очередной хайповый проект под волну агентного кодинга?Если коротко — наверное серьёзно, но мне сейчас не нужно. Тебе, скорее всего, тоже. Сейчас расскажу, что там и почему я так думаю.Что Zero на самом деле делает

продолжить чтение

Прогнал семь LLM через свой русский спортивный бенчмарк. Базовой моделью всё равно оставляю Gemma 4 31B

TL;DR — leaderboard за один взглядЗа последние 2 недели собрал открытый бенчмарк из 655 экспертных вопросов по 35 видам спорта на русском. Запустил семь моделей через ансамбль из трёх судей: Claude Opus 4.7, Gemini 3.1 Pro, GPT-5.5, DeepSeek V4 Flash, Qwen 3.5 27B, Gemma 4 31B, Qwen 3.6 27B.Frontier-closed (Opus / Gemini / GPT-5.5) — топ-3 по сырым цифрам. Открытый топ (DeepSeek V4 Flash) — четвёртая позиция, +0.58 от Gemma. И всё равно базой ЛИИ остаётся Gemma 4 31B. Защита позиции — три аргумента + разбор где конкретно живёт разрыв и почему он SFT-recoverable.РангМодельВесаnТочностьПолнота

продолжить чтение

Как мы за 54 дня собрали ИИ-хаб в мессенджере MAX. Часть 1 — обзор цикла

TL;DR54 дня назад у нас была идея — единый чат‑бот, через который можно работать с разными моделями ИИ. Сегодня в проде: бот в мессенджере MAX, 5903 пользователя, ~300 DAU, премиум‑подписка через ЮКассу с автоплатежами, 10+ моделей ИИ под одним интерфейсом, 6 модальностей ввода. Платежи запустили 5 мая 2026.Команда: нас двое плюс AI‑ассистент в роли парного программиста. IT‑ бэкграунд есть, но в коммерческой разработке мы не работали. С n8n до этого знакомились на уровне «10 нод поковырять». Сейчас в проекте около 20 связанных воркфлоу, в одном только Main — 271 нода.Это первая статья из цикла.

продолжить чтение

GPT-шорткаты: что работает, а что нет

В TikTok, Telegram и YouTube постоянно появляются «секретные команды» для GPT: IQ200 — «режим сверхразума», /UNFILTER — «без цензуры», X10THINK — «думает в 10 раз глубже».Спойлер: большинство — мифы. Но часть шорткатов действительно полезна — не потому что включает скрытые режимы, а потому что хорошо формулирует задачу.Я собрал популярные GPT-шорткаты, проверил на практике и разделил на три группы:✅ реально полезные⚠️ нестабильные❌ бесполезные (легенды)Это не reverse engineering OpenAI, а практический обзор для ежедневной работы с LLM.Содержание

продолжить чтение

80% встреч проводятся по принципу родительского собрания

Люди в среднем не умеют проводить встречи. Меня это дико бесило, когда я впервые столкнулся с качеством принятия решений на родительских собраниях. Оно близко к отрицательному.Мы тут писали транскрибатор встреч — это когда можно загрузить запись в трекер и получить список задач на выходе. За время тестов мы узнали, что про архитектуру встречи вообще никто не думает, а чтобы у неё было продолжение — ну там, следующие шаги, ответственные, сроки и задачи на выходе — это вообще необязательно.Коротко основное, что может показаться вам странным:

продолжить чтение

Не робот, а коллега: как ИИ‑агент стал частью команды медпульта

Привет, Хабр! Меня зовут Иван. Я работаю аналитиком в компании «Совкомбанк Технологии»: собираю требования, разбираю процессы с пользователями и помогаю доводить ИИ‑решения от этапа идеи до работающего сервиса. В этой статье расскажу, как мы с командой внедряли ИИ‑агента в работу медицинского пульта страховой компании.Коротко о команде: над проектом работали аналитик, backend‑разработчики, специалист по интеграциям, ML/LLM‑инженеры, тестировщики и представители бизнеса.

продолжить чтение

Мы пытались заменить QA нейросетью. Не получилось

ВступлениеХочется поговорить о том, что происходит с QA в 2026-м и правда ли, что «нас вот-вот заменит ИИ». Но не в формате очередного треда в духе «всё пропало» или «всё отлично, завтра уволим половину отдела». А по-взрослому: с опытом, цифрами, ограничениями и выводами. То есть попробовать не просто порассуждать, а разобрать тему как небольшое исследование: что реально меняется, где ИИ помогает, а где начинается та самая реальность, которая не влезает в красивую презентацию.

продолжить чтение