Практические приёмы и сдвиги для Go-backend инженера с фокусом на агентов: было так — стало так — попробуй так.
🗓 окно 10–17 августа 2026⚡ приёмов: 9👀 на заметку: 4📡 постов отсканировано: 160
🔥 О чём говорят на этой неделе
На этой неделе обсуждали не новые модели, а то, как читать и проверять их вывод. Arena разобрала десятки тысяч ответов Opus и Fable версий 4.5–5: Opus 5 пишет в среднем 510 слов против 158 у Opus 4.5, то есть втрое длиннее, при этом словарь стал проще. Hamel Husain прямо говорит, что перестал понимать объяснения модели, а Shreya Shankar вместо жалоб написала скилл и прогнала eval на сам скилл, с таблицей побед по каждому правилу. Второй сюжет недели — водяные знаки в тексте Claude по EU AI Act и обещанный API детекции. Третий, самый полезный на ревью: Victor Taelin переписывает компилятор руками не из-за ошибок агента, а из-за кода «не неправильного, но глупого».
⚡
Главные приёмы недели
Девять приёмов, которые можно применить за вечер. Каждый — с триадой «было / стало / попробовать» и ссылкой на первоисточник.
Агент задаёт один вопрос, ждёт ответа, задаёт следующий — и на каждом круге ты заново поднимаешь контекст задачи в голове.
→
Стало
Команда /align-me заставляет агента выдать пачку вопросов сразу: отвечаешь на 2–10 за один заход, дальше он планирует.
Почему лучше: swyx сравнивает это со спекулятивным декодированием — выигрыш не в скорости модели, а в том, что заглядываешь на несколько шагов вперёд и не платишь за каждый круг переключением внимания. Про исследование вариантов дизайна он пишет, что так работает несравнимо лучше.
⚡ Попробовать за вечер
Завести свою слэш-команду (у Claude Code это файл в ~/.claude/commands/) с одной установкой: «задай сразу 5–10 вопросов списком, дождись всех ответов, только потом планируй».
Прогнать её на задаче, где много неизвестного: схема таблицы, формат ответа API, раскладка воркеров по очередям.
Отвечать строго списком, в том же порядке — так агенту не нужно догадываться, к чему относится реплика.
Замерить: сколько кругов «вопрос — ответ» ушло на задачу до и после.
из твита @swyx
На картинке: результат одного прогона — три варианта интерфейса (Tournament Table, Command Atlas, Field Kit Folio), под каждым вывод: у второго лучшая читаемость и он ближе к продакшену, у третьего самый высокий риск реализации. Файлы репозитория при этом не менялись.
PR меняет состояние интерфейса, а ревьюер видит только диф и, чтобы понять результат, собирает ветку у себя.
→
Стало
В общий AGENTS.md добавлена короткая инструкция: меняешь состояние UI — приложи к PR видео.
Почему лучше: доказательство приезжает вместе с кодом, и ревью превращается из чтения дифа в тридцатисекундный просмотр. Правило живёт в общем файле, поэтому его исполняет агент, а не человек по памяти.
⚡ Попробовать за вечер
Дописать в свой AGENTS.md или CLAUDE.md одну строку: PR меняет состояние UI — приложи видео.
Механику взять с картинки ниже: файл уходит на uploads.github.com/user-attachments/assets обычным curl с заголовком Authorization: Bearer $(gh auth token), а вернувшийся .url вставляется в описание отдельной строкой — синтаксис ![]() плеер не рендерит.
Если сценарий пишет Playwright, он отдаёт webm; перед загрузкой прогнать через ffmpeg:
Замерить: сколько раз за неделю ревьюер спросил «а что тут визуально поменялось».
из твита @steipete
На картинке: сама инструкция. Тот же CDN, что при перетаскивании файла мышкой, права наследуются от репозитория, браузер не нужен. Коды ошибок расписаны: 422 — неподдерживаемый тип, 404 — неверный id репозитория или нет прав на запись. Отдельно запрещено пушить доказательства в ветки продуктового репозитория и коммитить .github/pr-assets.
Код агента принимают, если он работает и тесты зелёные: ошибок нет — значит, годится.
→
Стало
Отдельный проход ищет обобщённые механизмы там, где хватило бы поменять одно определение выше по стеку.
Почему лучше: у Taelin в stdlib языка Bend String и List<Char> были синонимами с разными представлениями в рантайме. Агент заметил это и встроил в компилятор общий «representation coercion engine». Не ошибка — но и не нужно: достаточно изменить представление String, и весь слой исчезает. По его оценке, такой код раздувает кодовую базу в 2–3 раза, поэтому он переписывает её руками, а не потому, что агент ошибся.
⚡ Попробовать за вечер
Взять последний PR от агента и найти самый большой новый слой абстракции: адаптер, конвертер, стратегию, «универсальный» хелпер.
Задать по нему один вопрос: какое определение выше по стеку надо поменять, чтобы этот слой стал не нужен.
Дописать правило в AGENTS.md: прежде чем вводить обобщённый механизм, предложи вариант, где он не нужен, и объясни, почему он не подошёл.
Замерить: сколько строк удалилось после ответа на этот вопрос.
одно определение выше по стеку убирает целый слой ниже
«Текст модели читается плохо» — ощущение, которое нечем подкрепить, поэтому спор упирается во вкус и заканчивается ничем.
→
Стало
У ощущения есть числа. Arena разобрала десятки тысяч реальных ответов Opus и Fable версий 4.5–5 и выложила метрики, которые считаются грепом за минуту.
Почему лучше: Opus 5 отвечает в среднем 510 слов против 158 у Opus 4.5, при этом доля длинных содержательных слов упала с 46,9% до 40,1% — ответы стали длиннее и проще одновременно. Тире на 1000 слов: 14,9 у Opus 5 против 6,5 у Opus 4.5; точки с запятой — 4,62 против 1,23. Это не рейтинг моделей, а список признаков, по которым видно, что текст никто не редактировал. Hamel Husain на той же неделе написал, что не может пользоваться Opus 5: код модель по-прежнему пишет, а объяснить понятно уже не выходит.
⚡ Попробовать за вечер
Взять 20 последних ответов своего агента одним файлом и посчитать маркеры:
grep -o '—' out.md | wc -l # тире
grep -o ';' out.md | wc -l # точки с запятой
wc -w out.md # слов всего
Пересчитать на 1000 слов и сравнить с ориентирами Arena: 14,9 тире — это уровень Opus 5, 6,5 — уровень Opus 4.5.
Запретить найденные маркеры в промпте или скилле и перезамерить те же 20 ответов.
Замерить: тире на 1000 слов и средняя длина ответа до и после.
из твита @arena
На картинке: четыре маркера, которые ловятся грепом. Тире у Opus 5 стало в 2,3 раза больше, чем у 4.5, точек с запятой — почти вчетверо. Открывающие согласия («yes, exactly») чаще всего у Fable 5 — 2,36% ответов.
из твита @arena
На картинке: ответы удлинились втрое (510 против 158 слов), предложения — с 7,74 до 12,22 слова, а доля длинных содержательных слов при этом упала до 40,1%. Больше текста, беднее словарь.
Правила письма лежат в CLAUDE.md как надежда: «пиши просто, без жаргона». Работают они или мешают — неизвестно.
→
Стало
У скилла есть свой eval: один и тот же агент прогоняется со скиллом и без него, а модель-судья оценивает каждое правило отдельно.
Почему лучше: на выходе не общая оценка, а таблица по правилам — и сразу видно, где скилл проигрывает базовому агенту. У Shreya Shankar правило «использовать простые обиходные слова» выигрывает 61 раз против 5 — это 92% побед без учёта ничьих. «Без жаргона» — 52 против 4 при 11 ничьих. А вот два правила базовый агент выигрывает: «сокращения допустимы» — 8 против 9 при 50 ничьих, «не больше двух придаточных в предложении и не больше двух примеров подряд» — 22 против 38. Такое правило надо не защищать, а выбрасывать.
⚡ Попробовать за вечер
Выбрать из своего CLAUDE.md пять правил и записать каждое отдельным проверяемым критерием, а не общим пожеланием.
Прогнать 20 своих типовых задач дважды: со скиллом и без. Судьёй поставить модель и просить вердикт по каждому критерию отдельно, а не одну оценку за текст.
Выкинуть правила, где скилл не выигрывает у базы, и не спорить с числами.
Замерить: доля правил, где скилл выигрывает, и сколько правил пришлось удалить.
из твита @sh_reya
На картинке: верхняя таблица — правила с самым большим отрывом: простые слова 61/5/1, без жаргона 52/4/11, без тире и срединных точек 35/1/31, прямые кавычки вместо типографских 33/1/33. Нижняя — два правила, где база выигрывает чаще: «сокращения допустимы» 8/9/50 и «не больше двух придаточных» 22/38/7.
Классификацию гоняют целиком на большой модели, потому что так спокойнее: каждый тикет, каждая строка лога — по полной цене.
→
Стало
Большая модель размечает около 500 записей, по её уверенности подбирается порог, дальше поток идёт через маленькую модель, а наверх уходит только то, что ниже порога.
Почему лучше: порог подбирается под нужное согласие с большой моделью, поэтому качество остаётся управляемым, а не «надеемся, маленькая справится». Shreya Shankar сообщает об экономии 90% и больше на разных задачах классификации. Отличие от готовых роутеров она разбирает отдельно: здесь ты сам видишь, какой порог что стоит.
⚡ Попробовать за вечер
Выбрать один живой классификатор: роутинг тикетов, разметка логов, предварительная модерация.
Разметить около 500 записей большой моделью и сохранить рядом значения уверенности.
Подобрать порог под целевое согласие с большой моделью, а всё, что ниже, отправлять на эскалацию.
Замерить: цену за 1000 запросов и долю эскалаций до и после.
большая модель нужна только там, где маленькая не уверена
Агента отпускают на большую задачу, а потом смотрят глазами: похоже на готовое или ещё нет.
→
Стало
Сначала пишется eval на паритет функций, и агент грызёт задачу против этого критерия, пока не наберёт 100%.
Почему лучше: у длинного автономного прогона появляется измеримый критерий остановки. У Brandon Chu паритет функций дошёл до 100% на eval примерно за полтора дня, ещё два дня ушли на полировку, CLI и MCP — при нулевых знаниях о предметной области. У yazins тот же приём с разделением ролей: план строит Codex GPT 5.6 Sol High, реализует Opus 5 через Cursor, прогон 4,5 часа подряд, затем около десяти кругов правок через Cursor CLI. Оба участвовали в конкурсе swyx «Kill my SaaS», и оба измеряли готовность, а не обсуждали её.
⚡ Попробовать за вечер
Перед следующей большой задачей выписать 10–20 проверок «готово» в виде исполняемого eval, а не текстом в тикете.
Разделить роли моделей: одна строит план, другая пишет код. Планировщику дать высокий уровень рассуждений, исполнителю — доступ к репозиторию.
Отпустить агента на длинный прогон и сверяться только с процентом пройденного eval.
Замерить: процент eval при первой остановке и сколько кругов правок понадобилось после.
Сложный поиск отправляют POST-ом, потому что в GET тело не положить. Кэширование и идемпотентность теряются, а фильтры в query string упираются в длину URL.
→
Стало
Есть метод QUERY (RFC 10008): тело как у POST, свойства как у GET — безопасный, идемпотентный, кэшируемый.
Почему лучше: поиск наконец описывается честно, а не как «создание ресурса». К тяжёлым запросам возвращаются кэш на прокси и безопасные повторы. По словам автора твита, метод появился в июне 2026 года и на серверах уже работает: Node.js, Go, Laravel. Там же честное предупреждение: браузеры поддержку ещё дорабатывают, широкое распространение он ждёт позже в 2026 году.
⚡ Попробовать за вечер
Взять один свой POST /search и завести рядом обработку нового метода — в Go это проверка r.Method == "QUERY" с тем же телом запроса.
Почему лучше: Simon Willison опубликовал разбор Qwen 3.8 27B и говорит, что давно не получал столько удовольствия от локальной модели на своих машинах. Двумя днями раньше он запускал предыдущую версию, Qwen 3.7 27B, как 17-гигабайтный GGUF в LM Studio на ноутбуке M5 Max. Hugging Face в обзоре открытых моделей за лето отмечает то же: маленькие модели держат основную долю реального использования, и в локальном запуске ведёт Qwen. Для backend это означает, что массовый и приватный путь запроса можно унести с облака.
⚡ Попробовать за вечер
Запустить команду и направить на неё один скучный массовый вызов: классификация, извлечение полей из текста, сжатие логов в одну строку.
Сравнить задержку и качество с текущей облачной моделью на 50 одинаковых входах, а не на трёх примерах.
Проверить уровень рассуждений: Simon Willison отмечает, что в LM Studio дефолтное «extra high» превращает эту модель в хронического тугодума. Ему это скорее нравится, а на массовом потоке уровень стоит понизить.
Замерить: доля запросов, которые ушли локально без просадки качества, и сэкономленная сумма за месяц.
Это часть работы с EU AI Act, и другие лаборатории добавляют похожее. Обещан API детекции текста, которым можно будет пользоваться самому. В своём FAQ Anthropic отдельно проговаривает: скрытых символов нет, лишних токенов нет, цена не меняется, метку нельзя связать с конкретным человеком или чатом. Hamel Husain в затею не верит: появятся инструменты для снятия метки, а результатом станет лишняя возня вместо прозрачности.
Контекст на 1M токенов для GPT-5.6 Sol в Codex раньше работал только с API-ключом, теперь доступен и через аккаунт ChatGPT. В том же сообщении предупреждение от команды: текущая длина контекста стоит по умолчанию не случайно, её настраивали. Полезная привычка на такой случай — замерить свою задачу до того, как крутить ручку.
Вводная цена на 3.7 Flash удваивается 31 декабря 2026 года. Simon Willison замечает странность: кто вообще рассчитывает пользоваться этой моделью через пять месяцев, если предыдущая версия вышла всего тремя неделями раньше? Вывод для backend простой: имя модели держать в конфиге, а стоимость пересчитывать после каждого релиза, а не раз в год.
steipete перевёл команду на сборку openclaw через сам openclaw и называет суперсилой саму возможность делиться сессиями агента по ссылке. Он же коротко описывает траекторию: CLI был год назад, приложения — примерно полгода, сейчас сервисы, веб и облачные сессии. Рядом OpenAI объявила импорт проектов, чатов, скиллов и плагинов из другого агента с необязательным автообновлением, то есть наработки перестают быть привязанными к одному харнессу. Для нас это меняет одну привычку: контекст можно передать ссылкой, а не пересказом.
из твита @steipete
На картинке: вся механика в трёх репликах. Агент зовёт человека в обсуждение, тот отвечает «I lack context», и в ответ приходит не пересказ, а ссылка на саму сессию.