llm.
Персональные инструменты как пет-проект
Писать и организовывать код — это лучшее, что я умею. Код как хобби за более чем 15 лет в индустрии оставил за собой кладбище пет-проектов. К чему-то банально угасал интерес, что-то переставало быть актуальным, что-то делалось просто чтобы потренироваться, в чём-то было лень разбираться после перерыва — итог всегда один.
Нужна ли умная модель для рутины? Дал четырём моделям пять одинаковых задач и сравнил
На этой неделе на Хабре спорили, нужны ли программисту самые умные модели: «Я перестал пользоваться самыми умными ИИ‑моделями». Автор считает, что для рутины хватает дешёвых, а упирается всё теперь в скорость. Под статьёй почти триста комментариев. Я прочитал, наверное, половину: мнений много, замеров на одинаковых задачах не нашёл ни одного. Стало интересно, сел и проверил на своих.Что мерилВзял пять задач из тех, что обычно скидываю агенту и иду за кофе. Всё на Python, от одного до пяти файлов:Off-by-one в пагинации, тест падает, надо починить.
Все числа на месте, а смысл изменился: как проверять правки ИИ
Анна получила 30 000 рублей. Борис получил 50 000 рублей.После редактуры:Анна получила 50 000 рублей. Борис получил 30 000 рублей.Оба имени на месте. Обе суммы тоже. Только деньги достались не тем людям.Это нарочно грубый пример: ошибку видно сразу. Но если проверять текст по списку сохранившихся имён и чисел, придраться не к чему. Именно поэтому ответ «факты сохранены» требует уточнения: что проверка считает фактом?Я развиваю humanizer-ru
ИИ-агенту запретили запись в CRM. Но CRM всё равно изменилась
ИИ-агенту запретили запись в CRM. Но CRM всё равно измениласьПочему ограничения на уровне модели ещё не означают, что вся AI-система работает в режиме read-only — и почему это важно перед production rollout, расширением полномочий агента и передачей решения клиенту.В первой статье я разбирал более узкий случай: человек одобряет одно действие, а downstream-workflow способен попытаться выполнить другое. Там вопрос был в целостности цепочки approval → execution.Здесь хочу посмотреть на ту же проблему шире. Если самой модели запрещена запись, означает ли это, что вся AI-система
Jev: как устроен его API решений и что на нём уже строят
15 сентября TypeSafe показала Jev (произносится Джев)
ИИ в тестировании: разбираем падения автотестов, оцениваем LLM и строим обвязку агентов
В августе прошёл Bugs Busters — митап для QA-специалистов от ЮMoney. Спикеры компании рассказали, как применяют ИИ для анализа причин падения e2e-автотестов, как устроен инструмент для подбора оптимальной LLM-модели под конкретную задачу и как строить обвязку вокруг агентов. Пропустили митап? Собрали главное из докладов и приложили записи выступлений.Разбираем падения автотестов с помощью ИИ
Запустить LLM локально: что считать до покупки видеокарты?
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса
FIT Visualizer: как я дошёл от ошибки Google AI до собственного анализатора тренировок
Всё началось с выбора велокомпьютера.Я сравнивал несколько недорогих вариантов — в частности, Sigma ROX 4.0 примерно за 80 евро и CYCPLUS M1 примерно за 50. По возможностям они выглядели достаточно похоже, поэтому я решил спросить совета у Google AI.Google AI, среди прочего, сообщил мне, что основные преимущества Sigma ROX 4.0 раскроются на моём электровелосипеде, а CYCPLUS M1 можно подключить к компьютеру по USB как Mass Storage и забрать с него файлы тренировок для дальнейшего анализа. Электровелосипеда у меня нет, поэтому был выбран CYCPLUS M1.

