Бесплатного интеллекта не бывает: кто оплачивает данные для LLM
Привет, Хабр! По первому образованию я юрист. Успел поработать в прокуратуре и арбитражном суде, потом ушёл в ИТ и последние 13 лет занимаюсь инфраструктурой, разработкой и DevOps. Сейчас строю MLOps-платформы.Этот опыт мешает мне спокойно читать споры об авторском праве и генеративном ИИ. Юрист видит пробелы учета прав в копировании чужих книг. Инженер — цепочку операций: crawler, raw storage, очистку, дедупликацию, training mix, веса, API. Между «скачали страницу» и «модель ответила пользователю» слишком много разных операций, чтобы обсуждать их одним словом «обучение».Отправной точкой для этого разбора стала
Агент пишет код. Что тогда остаётся инженеру данных?
Здравый смыслВ работе инженера данных хватает повторяющихся задач: забрать данные из API, проверить структуру, преобразовать поля, записать результат в хранилище. Вокруг этого — настройки, тесты, сообщения об ошибках и документация.Такую работу удобно поручать Агенту. Например:
LLM не должен читать логи без ограничений: безопасный MCP-шлюз для разбора сбоев
В понедельник утром пайплайн упал. В чате уже есть три версии причины: «сеть», «база опять задумалась» и «давайте просто перезапустим». Ассистент мог бы за минуту собрать список упавших задач, показать зависимые пайплайны и выдать первую гипотезу. Но для этого ему часто отдают доступ к логам, метаданным и иногда — не будем показывать пальцем — к произвольному SQL.Так делать не стоит. Достаточно, что модель прочитает токен в логе, получит инструкцию из текста ошибки или отправит в базу слишком дорогой запрос. У инженера тут должен сработать простой вопрос: «Можно. А зачем?»
«Диасофт» добавил ИИ‑функции и интеграцию с 1С в «Каталог метаданных»
Компания «Диасофт» расширила функциональность продукта «Каталог метаданных», входящего в состав решения «Фабрика данных» (Digital Q.DataFactory). В обновленной версии появились автоматическое заполнение бизнес‑глоссария с помощью ИИ, интеграция с информационными базами 1С, сквозная цепочка происхождения данных для отчетов «Генератора отчетов BIRT», а также возможность формировать SQL‑запросы на естественном языке.Автозаполнение бизнес‑глоссария
Система экстренных оповещений на 15 тысяч пользователей: LLM, PostGIS, Qdrant и Telegram
В нашем телеграм-боте — системе экстренных оповещений «Мигалка» — нужно в реальном времени обрабатывать сообщения примерно из тысячи телеграм-каналов и доставлять релевантные события пользователям в конкретных локациях.Официальные предупреждения о прилетах дронов и ракетных ударах часто приходят
Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно
Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга:Какая пеня установлена в договоре № 14/24.7645?Кто из арендаторов не заплатил за май?А у него предусмотрена индексация?Контрагент предлагает добавить пеню в 0,01%. Насколько это существенно?
650 млн точек, 3 поломки и PI System: технический разбор предиктивной аналитики на НПЗ (часть 2)
Часть 2 из 2. В первой части серии мы предсказали отказ насоса за 60 дней и выяснили, что годами чинили не то. Увидели, что материал встретил вашу живую реакцию, поэтому возвращаемся по горячим следам со второй частью. В этом материале, как и обещали, погружаемся в технику. Расскажем, что было под капотом, как решалась судьба насоса и с какими сложностями мы столкнулись.
Вышла новая модель? Не смотри на бенчмарки, смотри на поисковик за её спиной
В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры. Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.
Как мы научили ML предсказывать смерть насоса за 60 дней и выяснили, что все время чинили не то (часть 1)
История о том, как мы боролись с «цифровой слепотой», разрозненными данными и недоверием к ML, чтобы построить систему предиктивной аналитики для реального нефтеперерабатывающего завода. Часть 1 из 2.

