python.

I Gave an AI the Same 20 Coding Tasks With Short and Detailed Prompts — More Context Didn’t Always Produce Better Code

There is a habit I picked up after using AI for coding for a while. Whenever the generated code was not quite right, I added more context. Then a little more. Input formats, edge cases, performance requirements, error handling, preferred architecture, things the function should not do. Eventually a two-line request could turn into a small technical specification.It feels logical. A developer cannot read your mind, so why should an AI model be able to? More information should remove ambiguity and give better code. But after a few cases where a detailed prompt produced something strangely overengineered, I started wondering whether this assumption was actually true for small programming tasks.So I made a small experiment. I prepared 20 coding problems and sent every problem to the same model twice. The first version was intentionally short. The second explained almost everything I could reasonably explain without giving away the solution. There were 40 generated solutions in total. No follow-up messages, no asking the model to fix a failing test, no manually repairing imports. The first answer was the answer.

продолжить чтение

Долговременная память для ИИ-ассистента: как превратить переписку в Telegram в структурированную базу знаний

продолжить чтение

Собрал мониторинг упоминаний бренда в ChatGPT: три способа сбора данных показали три разные картины

Для одного из клиентов собрал упоминания бренда в ответах ChatGPT. Как обычно — на 20 вопросов, но теперь тремя разными способами. Бренд без подсказки прозвучал на одном вопросе из 19 в первом съёме и ни разу в двух других. А теперь к деталям.Что я измерял и на каких вопросах

продолжить чтение

Bio_news: как я делал ИИшный дайджест новостей по биологии

Короткий дисклеймер: Проект живой, ленту бот крутит дважды в сутки. Почитать готовый результат можно в моём Telegram‑канале Bio_news (ссылка в конце), а покритиковать — тут. А теперь к тому, как вся эта система устроена. Введение (Кто меня пнул или что меня пнуло?) Биология, как известно, — наука XXI века. Сейчас ею занимаются все, кому не лень, ну а те немногие, кто не занимается профессионально, как минимум активно интересуются. При этом «мокрых» данных генерируется огромное количество, а уж in silico

продолжить чтение

Когда разработчики ленятся писать документацию: описываем клиентский API силами нейросетей

Автор: Александр Казанцев, руководитель отдела документации и контентаПредставьте себе код, который был создан достаточно давно,после этого не подвергался сильному рефакторингу, а только дописывался и частично обновлялся. У него нет REST/FAST API реализации, его писали и пишут разные разработчики и заставить их выдать вменяемую документацию задача еще та (даже если они пытаются). А раз нет REST API, то нельзя например прикрутить тот же Swagger. 

продолжить чтение

Прыжок в бесконечность: как под капотом работает RBF SVM

Всех приветствую! Меня зовут Андрей, я студент 4 курса факультета математики и компьютерных наук, автор телеграм‑канала Andre | Data Science. Все мы знаем, что направление машинного обучения сейчас на огромном хайпе — практически из‑под каждого камня говорят о разных методах и о том, что они способны решить практически любую задачу. Но гайдов, которые бы подробно разбирали работу конкретного метода — от обычной загрузки данных до математического обоснования принципа его работы и визуализации каждого шага, — катастрофически мало.

продолжить чтение

I Gave 11 LLMs a False Premise. All 11 Confirmed It

I benchmark models on a repo of my own. This round I stopped testing whether they can fix a bug, and tested whether they can refuse to.Eleven models got a ticket. Fifteen of its sixteen items were already fixed — decoys, to see who checks before patching. The last item asked them to document an invariant, and I stated that invariant as settled fact with three bullets of evidence.All eleven agreed with me. The invariant was false — I had written the premise myself, and it took three lines of Python to break it.Here is what they produced instead of catching it, what it cost in tokens, and the one model that came within ten lines of the answer and walked past.1. What kind of task this wasNot a bug hunt. The previous round handed 9 models a 16-item defect list; not one checked the live source first, several patched functions deleted weeks earlier, and two shipped changes that left the suite red because they never opened the tests pinning the old contract.So this round was built around that failure. By the time it ran, 15 of the 16 items were already fixed.

продолжить чтение

Активировать мало — недостаточно: почему AI-роутеру могут понадобиться альтернативные стратегии

В предыдущем материале я рассказывал, как использую генеративные модели в роли оппонентов: прошу их не подтверждать первое решение, а искать условия, при которых оно развалится.Из этой практики вырос вопрос, который уже не относится к организации моей работы.Почему от самой AI-системы мы так часто ожидаем одного ответа? Почему она должна как можно раньше выбрать единственный маршрут, если задача допускает несколько стратегий, цена ошибки неизвестна, а лучшим действием иногда оказывается отказ от действия?

продолжить чтение

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же

Я прогнал топ выдачи Google по «llm vram calculator» — от самого навороченного до однокнопочных. Все ошибаются в одном и том же: ни один не моделирует, что движок резервирует почти всю память под пул заранее, а не раздаёт её под KV по мере запросов. Ответ «сколько запросов влезет» из-за этого всегда мимо.Наивное большинство спотыкается ещё и о геометрию KV: на DeepSeek-V2-Lite обычная формула завышает память почти на порядок (в 7–11 раз). Разбираю обе ловушки и сверяю числа с живым vLLM.Ошибка №1: движок забирает память заранееПишете две строки:from vllm import LLM llm = LLM("meta-llama/Meta-Llama-3-8B-Instruct")

продолжить чтение

Как я держу документы и инструкции для агентов в актуальном состоянии

Как разложены документыОдин огромный файл в корне плохо обновляется точечно. Слои такие.На сервере лежит общий договор для всех агентов на машине (AGENTS.md и соседние правила рантайма). В репозитории проекта — свой AGENTS.md и операционный гайд: куда смотреть, какие инварианты нельзя ломать. В docs/ — потоки (FLOWS), известные проблемы и короткие записи «что искать, где лежит, чего не делать». Отдельно скилы: пошаговые сценарии на повторяющиеся действия, не вторая простыня архитектуры.

продолжить чтение