● X WEEKLY DIGEST · BACKEND / AGENTS

Приёмы недели из X

Практические приёмы и сдвиги для Go-backend инженера с фокусом на агентов: было так — стало так — попробуй так.

🗓 окно 10–17 августа 2026 ⚡ приёмов: 9 👀 на заметку: 4 📡 постов отсканировано: 160
🔥 О чём говорят на этой неделе

На этой неделе обсуждали не новые модели, а то, как читать и проверять их вывод. Arena разобрала десятки тысяч ответов Opus и Fable версий 4.5–5: Opus 5 пишет в среднем 510 слов против 158 у Opus 4.5, то есть втрое длиннее, при этом словарь стал проще. Hamel Husain прямо говорит, что перестал понимать объяснения модели, а Shreya Shankar вместо жалоб написала скилл и прогнала eval на сам скилл, с таблицей побед по каждому правилу. Второй сюжет недели — водяные знаки в тексте Claude по EU AI Act и обещанный API детекции. Третий, самый полезный на ревью: Victor Taelin переписывает компилятор руками не из-за ошибок агента, а из-за кода «не неправильного, но глупого».

Главные приёмы недели

Девять приёмов, которые можно применить за вечер. Каждый — с триадой «было / стало / попробовать» и ссылкой на первоисточник.

01

Спрашивать агента пачкой, а не по кругу

кто: @swyx идея от: @mattpocockuk @trq212
Было

Агент задаёт один вопрос, ждёт ответа, задаёт следующий — и на каждом круге ты заново поднимаешь контекст задачи в голове.

Стало

Команда /align-me заставляет агента выдать пачку вопросов сразу: отвечаешь на 2–10 за один заход, дальше он планирует.

Почему лучше: swyx сравнивает это со спекулятивным декодированием — выигрыш не в скорости модели, а в том, что заглядываешь на несколько шагов вперёд и не платишь за каждый круг переключением внимания. Про исследование вариантов дизайна он пишет, что так работает несравнимо лучше.

⚡ Попробовать за вечер
  • Завести свою слэш-команду (у Claude Code это файл в ~/.claude/commands/) с одной установкой: «задай сразу 5–10 вопросов списком, дождись всех ответов, только потом планируй».
  • Прогнать её на задаче, где много неизвестного: схема таблицы, формат ответа API, раскладка воркеров по очередям.
  • Отвечать строго списком, в том же порядке — так агенту не нужно догадываться, к чему относится реплика.
  • Замерить: сколько кругов «вопрос — ответ» ушло на задачу до и после.
Отчёт агента с тремя вариантами интерфейса и вердиктом по каждому из твита @swyx
На картинке: результат одного прогона — три варианта интерфейса (Tournament Table, Command Atlas, Field Kit Folio), под каждым вывод: у второго лучшая читаемость и он ближе к продакшену, у третьего самый высокий риск реализации. Файлы репозитория при этом не менялись.
02

Видео к каждому PR, который меняет интерфейс

кто: @steipete
Было

PR меняет состояние интерфейса, а ревьюер видит только диф и, чтобы понять результат, собирает ветку у себя.

Стало

В общий AGENTS.md добавлена короткая инструкция: меняешь состояние UI — приложи к PR видео.

Почему лучше: доказательство приезжает вместе с кодом, и ревью превращается из чтения дифа в тридцатисекундный просмотр. Правило живёт в общем файле, поэтому его исполняет агент, а не человек по памяти.

⚡ Попробовать за вечер
  • Дописать в свой AGENTS.md или CLAUDE.md одну строку: PR меняет состояние UI — приложи видео.
  • Механику взять с картинки ниже: файл уходит на uploads.github.com/user-attachments/assets обычным curl с заголовком Authorization: Bearer $(gh auth token), а вернувшийся .url вставляется в описание отдельной строкой — синтаксис ![]() плеер не рендерит.
  • Если сценарий пишет Playwright, он отдаёт webm; перед загрузкой прогнать через ffmpeg:
ffmpeg -i in.webm -c:v libx264 -pix_fmt yuv420p out.mp4
  • Замерить: сколько раз за неделю ревьюер спросил «а что тут визуально поменялось».
Текст инструкции в AGENTS.md с командой curl для загрузки вложений в PR и командой ffmpeg из твита @steipete
На картинке: сама инструкция. Тот же CDN, что при перетаскивании файла мышкой, права наследуются от репозитория, браузер не нужен. Коды ошибок расписаны: 422 — неподдерживаемый тип, 404 — неверный id репозитория или нет прав на запись. Отдельно запрещено пушить доказательства в ветки продуктового репозитория и коммитить .github/pr-assets.
03

Проход по ревью «не неправильно, но глупо»

кто: @VictorTaelin
Было

Код агента принимают, если он работает и тесты зелёные: ошибок нет — значит, годится.

Стало

Отдельный проход ищет обобщённые механизмы там, где хватило бы поменять одно определение выше по стеку.

Почему лучше: у Taelin в stdlib языка Bend String и List<Char> были синонимами с разными представлениями в рантайме. Агент заметил это и встроил в компилятор общий «representation coercion engine». Не ошибка — но и не нужно: достаточно изменить представление String, и весь слой исчезает. По его оценке, такой код раздувает кодовую базу в 2–3 раза, поэтому он переписывает её руками, а не потому, что агент ошибся.

⚡ Попробовать за вечер
  • Взять последний PR от агента и найти самый большой новый слой абстракции: адаптер, конвертер, стратегию, «универсальный» хелпер.
  • Задать по нему один вопрос: какое определение выше по стеку надо поменять, чтобы этот слой стал не нужен.
  • Дописать правило в AGENTS.md: прежде чем вводить обобщённый механизм, предложи вариант, где он не нужен, и объясни, почему он не подошёл.
  • Замерить: сколько строк удалилось после ответа на этот вопрос.
КАК СДЕЛАЛ АГЕНТ String List<Char> representation coercion engine компилятор кодовая база в 2–3 раза больше нужного КАК ХВАТИЛО БЫ одно представление на тип компилятор coercion engine слой не нужен и удаляется целиком
одно определение выше по стеку убирает целый слой ниже
04

Считать маркеры вместо спора о слоге

кто: @arena + поддержали: @HamelHusain @sh_reya
Было

«Текст модели читается плохо» — ощущение, которое нечем подкрепить, поэтому спор упирается во вкус и заканчивается ничем.

Стало

У ощущения есть числа. Arena разобрала десятки тысяч реальных ответов Opus и Fable версий 4.5–5 и выложила метрики, которые считаются грепом за минуту.

Почему лучше: Opus 5 отвечает в среднем 510 слов против 158 у Opus 4.5, при этом доля длинных содержательных слов упала с 46,9% до 40,1% — ответы стали длиннее и проще одновременно. Тире на 1000 слов: 14,9 у Opus 5 против 6,5 у Opus 4.5; точки с запятой — 4,62 против 1,23. Это не рейтинг моделей, а список признаков, по которым видно, что текст никто не редактировал. Hamel Husain на той же неделе написал, что не может пользоваться Opus 5: код модель по-прежнему пишет, а объяснить понятно уже не выходит.

⚡ Попробовать за вечер
  • Взять 20 последних ответов своего агента одним файлом и посчитать маркеры:
grep -o '—' out.md | wc -l # тире grep -o ';' out.md | wc -l # точки с запятой wc -w out.md # слов всего
  • Пересчитать на 1000 слов и сравнить с ориентирами Arena: 14,9 тире — это уровень Opus 5, 6,5 — уровень Opus 4.5.
  • Запретить найденные маркеры в промпте или скилле и перезамерить те же 20 ответов.
  • Замерить: тире на 1000 слов и средняя длина ответа до и после.
Графики Arena: тире, точки с запятой, слова honesty и открывающие согласия по версиям моделей из твита @arena
На картинке: четыре маркера, которые ловятся грепом. Тире у Opus 5 стало в 2,3 раза больше, чем у 4.5, точек с запятой — почти вчетверо. Открывающие согласия («yes, exactly») чаще всего у Fable 5 — 2,36% ответов.
Графики Arena: длина ответа, длина предложения, частота придаточных и доля длинных слов по версиям моделей из твита @arena
На картинке: ответы удлинились втрое (510 против 158 слов), предложения — с 7,74 до 12,22 слова, а доля длинных содержательных слов при этом упала до 40,1%. Больше текста, беднее словарь.
05

Eval не на модель, а на свой скилл

кто: @sh_reya + поддержал: @HamelHusain
Было

Правила письма лежат в CLAUDE.md как надежда: «пиши просто, без жаргона». Работают они или мешают — неизвестно.

Стало

У скилла есть свой eval: один и тот же агент прогоняется со скиллом и без него, а модель-судья оценивает каждое правило отдельно.

Почему лучше: на выходе не общая оценка, а таблица по правилам — и сразу видно, где скилл проигрывает базовому агенту. У Shreya Shankar правило «использовать простые обиходные слова» выигрывает 61 раз против 5 — это 92% побед без учёта ничьих. «Без жаргона» — 52 против 4 при 11 ничьих. А вот два правила базовый агент выигрывает: «сокращения допустимы» — 8 против 9 при 50 ничьих, «не больше двух придаточных в предложении и не больше двух примеров подряд» — 22 против 38. Такое правило надо не защищать, а выбрасывать.

⚡ Попробовать за вечер
  • Выбрать из своего CLAUDE.md пять правил и записать каждое отдельным проверяемым критерием, а не общим пожеланием.
  • Прогнать 20 своих типовых задач дважды: со скиллом и без. Судьёй поставить модель и просить вердикт по каждому критерию отдельно, а не одну оценку за текст.
  • Выкинуть правила, где скилл не выигрывает у базы, и не спорить с числами.
  • Замерить: доля правил, где скилл выигрывает, и сколько правил пришлось удалить.
Две таблицы с результатами eval по каждому правилу скилла: победы скилла, базы и ничьи из твита @sh_reya
На картинке: верхняя таблица — правила с самым большим отрывом: простые слова 61/5/1, без жаргона 52/4/11, без тире и срединных точек 35/1/31, прямые кавычки вместо типографских 33/1/33. Нижняя — два правила, где база выигрывает чаще: «сокращения допустимы» 8/9/50 и «не больше двух придаточных» 22/38/7.
06

Каскад моделей: порог уверенности вместо «всё большой моделью»

кто: @sh_reya рассказал: @HamelHusain
Было

Классификацию гоняют целиком на большой модели, потому что так спокойнее: каждый тикет, каждая строка лога — по полной цене.

Стало

Большая модель размечает около 500 записей, по её уверенности подбирается порог, дальше поток идёт через маленькую модель, а наверх уходит только то, что ниже порога.

Почему лучше: порог подбирается под нужное согласие с большой моделью, поэтому качество остаётся управляемым, а не «надеемся, маленькая справится». Shreya Shankar сообщает об экономии 90% и больше на разных задачах классификации. Отличие от готовых роутеров она разбирает отдельно: здесь ты сам видишь, какой порог что стоит.

⚡ Попробовать за вечер
  • Выбрать один живой классификатор: роутинг тикетов, разметка логов, предварительная модерация.
  • Разметить около 500 записей большой моделью и сохранить рядом значения уверенности.
  • Подобрать порог под целевое согласие с большой моделью, а всё, что ниже, отправлять на эскалацию.
  • Замерить: цену за 1000 запросов и долю эскалаций до и после.
ШАГ 1 · КАЛИБРОВКА ≈500 записей большая модель размечает и отдаёт уверенность порог под целевое согласие ниже порога = не доверяем ШАГ 2 · ПРОД поток запросов маленькая модель метка + уверенность уверенность ≥ порога? да нет метку принимаем, платим копейки эскалация в большую модель экономия 90% и больше — по данным доклада
большая модель нужна только там, где маленькая не уверена
07

Сначала eval готовности, потом длинный прогон агента

кто: @BrandonMChu @yazins конкурс: @swyx
Было

Агента отпускают на большую задачу, а потом смотрят глазами: похоже на готовое или ещё нет.

Стало

Сначала пишется eval на паритет функций, и агент грызёт задачу против этого критерия, пока не наберёт 100%.

Почему лучше: у длинного автономного прогона появляется измеримый критерий остановки. У Brandon Chu паритет функций дошёл до 100% на eval примерно за полтора дня, ещё два дня ушли на полировку, CLI и MCP — при нулевых знаниях о предметной области. У yazins тот же приём с разделением ролей: план строит Codex GPT 5.6 Sol High, реализует Opus 5 через Cursor, прогон 4,5 часа подряд, затем около десяти кругов правок через Cursor CLI. Оба участвовали в конкурсе swyx «Kill my SaaS», и оба измеряли готовность, а не обсуждали её.

⚡ Попробовать за вечер
  • Перед следующей большой задачей выписать 10–20 проверок «готово» в виде исполняемого eval, а не текстом в тикете.
  • Разделить роли моделей: одна строит план, другая пишет код. Планировщику дать высокий уровень рассуждений, исполнителю — доступ к репозиторию.
  • Отпустить агента на длинный прогон и сверяться только с процентом пройденного eval.
  • Замерить: процент eval при первой остановке и сколько кругов правок понадобилось после.
08

QUERY вместо POST для тяжёлого поиска

кто: @ipwanciu репостнул: @steipete
Было

Сложный поиск отправляют POST-ом, потому что в GET тело не положить. Кэширование и идемпотентность теряются, а фильтры в query string упираются в длину URL.

Стало

Есть метод QUERY (RFC 10008): тело как у POST, свойства как у GET — безопасный, идемпотентный, кэшируемый.

Почему лучше: поиск наконец описывается честно, а не как «создание ресурса». К тяжёлым запросам возвращаются кэш на прокси и безопасные повторы. По словам автора твита, метод появился в июне 2026 года и на серверах уже работает: Node.js, Go, Laravel. Там же честное предупреждение: браузеры поддержку ещё дорабатывают, широкое распространение он ждёт позже в 2026 году.

⚡ Попробовать за вечер
  • Взять один свой POST /search и завести рядом обработку нового метода — в Go это проверка r.Method == "QUERY" с тем же телом запроса.
  • Сходить руками и убедиться, что маршрут отвечает:
curl -X QUERY http://localhost:8080/search \ -H 'Content-Type: application/json' \ --data '{"filters":{"status":"active","price":{"max":100}}}'
  • Старый POST-путь не выключать: браузерная поддержка ещё в пути, так что это второй вход, а не замена.
  • Замерить: доля попаданий в кэш на тяжёлых поисковых запросах после переключения внутренних клиентов.
09

Локальная модель одной командой

кто: @ggerganov + поддержали: @simonw @huggingface
Было

Поднять локальную модель — это отдельный вечер: найти веса, скачать GGUF, разобраться с рантаймом, подобрать параметры.

Стало

Одна строка в терминале, вместе со спекулятивным декодированием — модель скачивается и поднимается сервером сама.

llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-mtp

Почему лучше: Simon Willison опубликовал разбор Qwen 3.8 27B и говорит, что давно не получал столько удовольствия от локальной модели на своих машинах. Двумя днями раньше он запускал предыдущую версию, Qwen 3.7 27B, как 17-гигабайтный GGUF в LM Studio на ноутбуке M5 Max. Hugging Face в обзоре открытых моделей за лето отмечает то же: маленькие модели держат основную долю реального использования, и в локальном запуске ведёт Qwen. Для backend это означает, что массовый и приватный путь запроса можно унести с облака.

⚡ Попробовать за вечер
  • Запустить команду и направить на неё один скучный массовый вызов: классификация, извлечение полей из текста, сжатие логов в одну строку.
  • Сравнить задержку и качество с текущей облачной моделью на 50 одинаковых входах, а не на трёх примерах.
  • Проверить уровень рассуждений: Simon Willison отмечает, что в LM Studio дефолтное «extra high» превращает эту модель в хронического тугодума. Ему это скорее нравится, а на массовом потоке уровень стоит понизить.
  • Замерить: доля запросов, которые ушли локально без просадки качества, и сэкономленная сумма за месяц.
💬

На что обратить внимание

Идеи, которые пока обсуждают, но в готовый приём ещё не сложились. Без «попробовать» — просто держать в голове.

🔖 Водяные знаки в тексте Claude и API детекции

Это часть работы с EU AI Act, и другие лаборатории добавляют похожее. Обещан API детекции текста, которым можно будет пользоваться самому. В своём FAQ Anthropic отдельно проговаривает: скрытых символов нет, лишних токенов нет, цена не меняется, метку нельзя связать с конкретным человеком или чатом. Hamel Husain в затею не верит: появятся инструменты для снятия метки, а результатом станет лишняя возня вместо прозрачности.

🧭 Миллион токенов контекста — и просьба не трогать дефолт

Контекст на 1M токенов для GPT-5.6 Sol в Codex раньше работал только с API-ключом, теперь доступен и через аккаунт ChatGPT. В том же сообщении предупреждение от команды: текущая длина контекста стоит по умолчанию не случайно, её настраивали. Полезная привычка на такой случай — замерить свою задачу до того, как крутить ручку.

💸 Вводная цена — плохая опора для выбора модели

Вводная цена на 3.7 Flash удваивается 31 декабря 2026 года. Simon Willison замечает странность: кто вообще рассчитывает пользоваться этой моделью через пять месяцев, если предыдущая версия вышла всего тремя неделями раньше? Вывод для backend простой: имя модели держать в конфиге, а стоимость пересчитывать после каждого релиза, а не раз в год.

🌐 Сессия агента переезжает из терминала в общую страницу

steipete перевёл команду на сборку openclaw через сам openclaw и называет суперсилой саму возможность делиться сессиями агента по ссылке. Он же коротко описывает траекторию: CLI был год назад, приложения — примерно полгода, сейчас сервисы, веб и облачные сессии. Рядом OpenAI объявила импорт проектов, чатов, скиллов и плагинов из другого агента с необязательным автообновлением, то есть наработки перестают быть привязанными к одному харнессу. Для нас это меняет одну привычку: контекст можно передать ссылкой, а не пересказом.

Переписка, где на реплику «мне не хватает контекста» агент присылает ссылку на сессию из твита @steipete
На картинке: вся механика в трёх репликах. Агент зовёт человека в обсуждение, тот отвечает «I lack context», и в ответ приходит не пересказ, а ссылка на саму сессию.
🎯

Мой план на эту неделю

Из девяти приёмов выше — три, которые реально внедрю. Не «прочитать», а внедрить.

Внедрить: строку в AGENTS.md про видео к PR, который меняет интерфейс, и прогнать её на первом же таком PR
сегодня
Внедрить: свою команду «вопросы пачкой» и обкатать её на выборе схемы для новой таблицы
до среды
Внедрить: каскад на одном классификаторе — 500 записей большой моделью, порог, эскалация ниже порога
до пятницы
#

Метаданные

сгенерировано 2026-08-17T07:12:18Z
окно 2026-08-10 — 2026-08-17 (7 дней)
отсканировано / в дайджест 160 постов / 13 пунктов (9 приёмов + 4 на заметку)
источник Nitter RSS (nitter.net), 18 хэндлов из 19; медиа — pbs.twimg.com; firecrawl не применялся
медиа скачано 14 картинок из 10 твитов, оставлено 6
пропущенные handles LatentSpacePod (зеркала недоступны), karpathy (нет постов в окне); без практического сигнала на этой неделе: alexalbert__, jxnlco, rasbt, charles_irl, jeremyphoward, AnthropicAI, GoogleDeepMind, _philschmid, hardmaru
×
Открыть твит