С чего начать тестирование LLM: 5 проверок из практики
Пять проверок — первое, что я делаю на новом LLM-проекте
Собрал ИИ-бенчмарк под себя из 2 месяцев своих сессий — и дорогие модели проиграли дешёвым
Собрал ИИ-бенчмарк под себя — и дорогие модели проиграли дешёвымПубличные лидерборды сходятся: сильнейшая открытая модель сейчас — GLM-5.2 на 744 миллиарда параметров. За ней — Kimi K2.6, DeepSeek V4. Я пару месяцев доверял этим таблицам и гонял через лучшие модели свою ежедневную работу.Потом измерил то, чего лидерборды не могут измерить — как работаю конкретно я. Тройка лидеров сжалась в ничью, а победила в практике модель в 37 раз дешевле GLM-5.2.Дальше — как я это мерил, на чём, какие были грабли, и почему «лучшая модель» и «лучшая модель для тебя» — это разные модели.Почему чужой лидерборд не подберет модель под тебя
Skill of the week: Spring Data JDBC — качество Opus на модели за копейки
Ранее в рубрике Skill of the Week мы уже разбирали Skill для Spring Data JPA
GEO для интернет-магазина: как карточки товаров попадают в ответы нейросетей
Привет, Хабр! Меня зовут Дмитрий, руководитель отдела рекламы и продвижения в Аспро. Мы запускаем интернет-магазины и развиваем систему управления бизнесом Аспро.Cloud.Раньше покупатель сам проходил путь: вводил запрос, открывал несколько вкладок, читал характеристики, сравнивал цены и условия доставки — и в итоге выбирал. Интернет-магазин конкурировал за место в выдаче и за то, чтобы человек остался именно на его странице.
Как мы превратили Swagger из документации в двигатель API-автотестов
Всем привет! Меня зовут Олег Малышев. Я один из лидеров стека тестирования в компании «ТехВилл»
«Почему только Anthropic?»: Конгресс засыпал Минторг США вопросами о блокировке Fable 5
Четверо членов Палаты представителей направили письмо
Что произойдет, если засунуть ЛЛМ в пластмассовую коробочку на ножках?
По всей видимости, домашние роботы на подходе. Не огромные андроиды в человеческий рост и на двух ногах, но маленькие компаньоны на сервоприводах. Которые научаться понимать человека и будут учиться через эмпирический опыт самостоятельно.Знакомьтесь, GrowbotGrowbot в первой итерации.
Крупных операторов АЗС в США обвинили в ценовом сговоре с помощью ИИ-инструментов
В Калифорнии водители подали иск против операторов автозаправочных станций, включая BP, Circle K, Marathon Petroleum, 7-Eleven, Walmart и Albertsons, обвинив их в использовании искусственного интеллекта для завышения цен на бензин.

