Галоўная > Дайджэст ШІ: 8–15 верасня 2026 года

Дайджэст ШІ: 8–15 верасня 2026 года

AI

🔥 Тыдзень, калі агентная інфраструктура стала прадуктам, а «аўтаномнасць» сутыкнулася з баг-трэкерам: Akuity і Kiteworks выпускаюць кіраванне ідэнтычнасцю і дадзенымі для агентаў, Anthropic дадае ў Claude Code Plugin Evals з Δ-метрыкай, Salesforce выкочвае сем гатовых агентаў, ExLlamaV3 паскарае лакальны MoE-інферэнс на 54%, а хвалёнае «рэактыўнае абуджэнне» ў Google Antigravity атрымлівае два адкрытыя багі за адзін тыдзень.

ℹ️ Пра склад гэтага выпуску. Частка I — падзеі 8–15 верасня. Частка II — даганяем: GPT-6 Astra, Claude Fable 5.1, MiniCPM5-2B і FrontierMath Erdős выйшлі 1–7 верасня і не трапілі ў папярэдні выпуск, таму разбіраем іх тут з захаваннем рэальных датаў. Частка III — аглядавы раздзел без прывязкі да канкрэтнай падзеі, пазначаны як такі.


1. Храналогія


ЧАСТКА I. Навіны тыдня: 8–15 верасня

2. Кіраванне агентамі становіцца прадуктам: Akuity і Kiteworks

За адзін тыдзень дзве кампаніі выпусцілі рашэнні для адной і той жа праблемы — агент дзейнічае, але ад чыйго імя і з якімі правамі?

Akuity Agentic Control Plane (14 верасня)

Akuity — кампанія стваральнікаў Argo CD і Kargo — запусціла Agentic Control Plane і Akuity MCP Server. Знешнія агенты (Claude, Codex, Cursor) атрымліваюць доступ да платформы Akuity — ад здароўя кластара да канкрэтнага коміта за кожным дэплоем.

Ключавое: ідэнтычнасць карыстальніка і яго RBAC-ролі пераносяцца ў запыты агента. Арганізацыя можа задаць узровень read-only / read-and-write / full незалежна ад звычайных правоў чалавека — г.зн. агент ад вашага імя можа мець менш правоў, чым вы самі (Help Net Security).

Kiteworks паглынае Bonfy.AI (8 верасня)

Kiteworks купіла ізраільскі стартап Bonfy.AI — runtime-класіфікацыя даных у момант перадачы, уключна з выпадкам, калі бокам абмену выступае AI-асістэнт ці аўтаномны агент. Палітыка прымяняецца да завяршэння перадачы, а не пасля яе.

Паводле прэс-рэлізу, гэта восьмае паглынанне Kiteworks менш чым за пяць гадоў; Calcalist ацэньвае здзелку ў «дзясяткі мільёнаў долараў». Паводле SecurityWeek, Bonfy заснаваны Гідзі Коэнам і Дэні Кібелем у пачатку 2024-га і выйшаў са стэлсу ў чэрвені 2025 пасля $9.5 млн seed. Help Net Security удакладняе механіку: «палітыка ацэньваецца і прымяняецца ў момант абмену... да таго, як адпраўка завершыцца», прычым вынікам з'яўляецца рашэнне, а не проста алерт.

Чаму на гэта раптам ёсць попыт — хроніка, якая да яго прывяла

Абодва прадукты — адказ на праблему, якая назапашвалася паўтара года. Ніжэй толькі інцыдэнты з публічнымі тэхнічнымі разборамі (звярніце ўвагу на даты — гэта фон, а не навіны тыдня):

  1. Postmark MCP, бэкдор з BCC — верасень 2025. Распрацоўшчык неафіцыйнага npm-пакета postmark-mcp скланаваў легітымны рэпазіторый Postmark і ў версіі 1.0.16 (17 верасня 2025) дадаў адзін радок: BCC кожнага зыходнага ліста на phan@giftshop[.]club. Першыя 15 версій пакет паводзіў сябе сумленна; на момант выяўлення меў каля 1500 спампоўванняў на тыдзень (Koi Security, The Hacker News).
  2. WhatsApp History Exfiltration — красавік 2025. Invariant Labs паказалі PoC: шкодны MCP-сервер у тым самым кантэксце агента, што і легітымны WhatsApp MCP, прымушае агента прачытаць гісторыю і адправіць яе на нумар зламысніка — прычым эксфільтрацыя ідзе праз сам WhatsApp (код для ўзнаўлення).
  3. FakeGit / AgentBaiting → SmartLoader — раскрыта ў ліпені 2026. Island апісаў ~7600 шкодных GitHub-рэпазіторыяў ад ~6600 падробленых профіляў; больш за 800 выдавалі сябе за AI Skills або MCP-серверы. Пік — красавік 2026, больш за 14 млн спамповак Release-асетаў, плацёж — стылер StealC. Прыём названы AgentBaiting: мішэнню становіцца сам агент, які шукае новую здольнасць, чытае README зламысніка як дакументацыю і сам перадае карыстальніку каманду ўсталёўкі (Island, The Hacker News).
  4. Маштаб — ліпень 2026. Island прасканаваў 33 563 апублікаваныя зборкі MCP-сервераў: у 49% знайшлася хаця б адна неінфармацыйная знаходка, 36% трапілі пад прыярытэтныя для рэвью правілы, у 40.6% хаця б адзін інструмент мог чытаць файлы ці credentials, выконваць код або рабіць дэструктыўныя дзеянні, 6.6% слухалі на 0.0.0.0 (Island).

    ⚠️ «49% са знаходкай» — гэта не «49% уразлівых сервераў». Верхняя мяжа сігналу, а не пацверджаныя ўразлівасці.

  5. MCPTox — жнівень 2025. Бэнчмарк на 45 рэальных серверах і 353 інструментах, 1312 шкодных тэст-кейсаў, 20 мадэляў. Максімальны attack success rate — 72.8% (o1-mini). Кантрынтуітыўны вынік: больш здольныя мадэлі часцей уразлівыя, бо атака эксплуатуе іх лепшае следаванне інструкцыям. Найвышэйшы refusal rate (Claude 3.7 Sonnet) — менш за 3%.

Механіка атакі. Зламыснік убудоўвае схаваныя інструкцыі ў метададзеныя MCP-інструмента (апісанне, schema). Апісанні трапляюць у кантэкст мадэлі як даверны тэкст — і выконваюцца. Microsoft Incident Response і Defender Research 30 чэрвеня 2026 паказалі, як атручанае апісанне прымушае Microsoft 365 Copilot, Copilot Studio і Azure AI Foundry аддаць чуллівыя дадзеныя без адзінага сек'юрыці-алерта. Гэта праблема мяжы даверу (trust boundary), а не памылка ў кодзе агента: апісанні трактуюцца як дадзеныя і таму абыходзяць працэсы рэвью, якія злавілі б змену коду. Паколькі MCP падхоплівае змены апісанняў дынамічна, атручаная версія актывуецца без новага пацверджання.

Базавыя меры — re-approval пры змене апісання інструмента, ізаляцыя чуллівых сервераў ад агульных, version pinning і hash-сумы (security best practices MCP-спецыфікацыі), а на ўзроўні ядра — eBPF для назірання і фільтрацыі сістэмных выклікаў без змены коду агента.

Крыніцы: Akuity — GlobeNewswire, 14.09.2026, Help Net Security — Akuity, Kiteworks — прэс-рэліз, 08.09.2026, Koi Security — postmark-mcp, Invariant Labs — WhatsApp MCP, Island — AgentBaiting, Island — скан 33K зборак, MCPTox (arXiv:2508.14925), Microsoft Security Blog


3. Reactive Wakeup: два адкрытыя багі за тыдзень

Ідэя рэактыўнага абуджэння агента простая і правільная: калі агент запусціў доўгі працэс (кампіляцыю, тэсты, міграцыю), ён не мусіць кожныя 5 секунд спамiць status ці sleep 10, спальваючы токены і засмечваючы кантэкст. Ён засынае, а сістэма будзіць яго ў момант падзеі.

Google Antigravity рухаецца ў гэты бок: у дзеп-дайве да I/O 2026 (19 мая 2026) апісаны субагенты з ізаляцыяй воркспейсаў, hooks і Scheduled Tasks, а дакументацыя CLI абяцае, што «сістэма аўтаматычна аднаўляе выкананне, калі прыходзіць паведамленне ад субагента ці peer-агента». Прадукт мае афіцыйныя пашырэнні для VS Code, Visual Studio, JetBrains, Zed і Xcode.

А цяпер рэальнасць — акурат на гэтым тыдні

У трэкеры google-antigravity/antigravity-cli за тыдзень з'явіліся два адкрытыя багі, якія паказваюць, што абяцанае не даехала да рэлізу:

  • Issue №977 — 8 верасня, Antigravity CLI 1.1.27. Архітэктура «expects Reactive Wakeup (No Polling Needed)», але пасля завяршэння фонавай каманды CLI застаецца маўклівым, і карыстальнік вымушаны ўручную пытацца «check progress». Прычыны: зламаны event dispatch паміж task supervisor і agent loop, turn-based deadlock, страчаныя process handles на Windows. Статус — адкрыты, stat:awaiting response.
  • Issue №1022 — 14 верасня. Паведамленні паміж агентамі не трапляюць у кантэкст, пакуль карыстальнік не націсне Enter: «pull-on-submit instead of push-to-screen».

Вывад: «канец полінгу» — пакуль дызайн-мэта, а не дасягнуты стан. Сам тэрмін Reactive Wakeup сустракаецца ў баг-рэпортах карыстальнікаў, а не як назва задакументаванай фічы. Калі будуеце ўласную агентную сістэму — закладайце падзейную мадэль з самага пачатку, але не разлічвайце, што чужы рантайм гарантуе дастаўку падзеі; трымайце таймаўт-фолбэк.

Крыніцы: Issue №977, Issue №1022, Antigravity Blog — I/O 2026 deep dive, Antigravity Docs — IDE extensions, Antigravity Docs — Background Tasks & Subagents


4. Plugin Evals у Claude Code v2.1.269 (11 верасня)

Plugin Evals — сістэма бэнчмаркінгу плагінаў і скілаў Claude Code, дададзеная ў v2.1.269. Мэта — перайсці ад «тэсціравання на адчуванні» да аўтаматызаваных CI-праверак:

  • Шэсць тыпаў грэйдэраў:
    • Дэтэрміністычныя (бясплатныя): regex, tool_used, tool_order, file_exists
    • З мадэллю-суддзёй (платныя): llm, baseline
  • Як лічыцца вынік: кожны кейс праганяецца тры разы па змаўчанні; вынік прагону — доля пройдзеных грэйдэраў, вынік кейса — сярэдняе па прагонах. Кейс пройдзены, калі дасягае --threshold (па змаўчанні 1.0).
  • Δ-метрыка: ядро ацэнкі — дэльта паміж вынікам з плагінам і без яго (грэйдэр baseline). Дадатная дэльта = плагін рэальна карысны.
  • Кантроль кошту: --max-cost-usd перарывае прагон з exit-кодам 2 і аддае частковыя вынікі замест таго, каб накруціць рахунак.
sh
1claude plugin eval . --trust-plugin --json results.json \
2  --threshold 0.8 --model claude-sonnet-5 --judge-model claude-haiku-4-5 \
3  --no-publish --max-cost-usd 20

Крыніцы: Claude Code Docs — Plugin Evals, MarkTechPost, 11.09.2026


5. Salesforce: сем гатовых агентаў напярэдадні Dreamforce (11 верасня)

11 верасня, за чатыры дні да Dreamforce, Salesforce прадставіла партфель з сямі job-ready агентаў для продажаў, сэрвісу, камерцыі, employee experience і бэк-офіса:

АгентРоляСтатус
Caseyпадтрымка кліентаў праз voice, SMS, WhatsApp, web chatGA
PaigeIT- і HR-сэрвіс праз Slack і парталыGA
Carterдапамога пакупніку: пошук тавару і чэкаутGA
Marshallsupply chain, скразныя бэк-офісныя працэсыGA
Piperinbound-лідагенерацыя на сайце і ў паштовай скрыніGA
Finскладаныя CX-сцэнары праз усе каналыGA
Hunteroutbound-продажыпілот, GA у лістападзе 2026

Заяўленыя вынікі кліентаў: 50% чат-запытаў Engine закрывае help-агент, а Hunter пабудаваў 60% пайплайну Perk. Лічбы — ад вендара, незалежнай праверкі няма.

Dreamforce 2026 праходзіць 15–17 верасня ў Moscone Center, Сан-Францыска — асноўныя кіноўты па Agentforce будуць ужо за межамі гэтага выпуску.

Крыніцы: Salesforce Newsroom, 11.09.2026, Salesforce — Dreamforce 2026, Dreamforce 26 media resources


6. Лакальны інферэнс: ExLlamaV3 v1.5.0 (13 верасня)

ExLlamaV3 ад turboderp выпусціў v1.5.0.

Важнае ўдакладненне: фармат квантавання EXL3 — не навінка гэтага рэлізу, гэта базавы фармат бібліятэкі з самага яе пачатку. Паводле README праекта, EXL3 — «спрошчаны варыянт QTIP ад Cornell RelaxML». QTIP расшыфроўваецца як Quantization with Trellises and Incoherence Processing (а не «Trellis-based Importance-aware Pruning» — такой назвы не існуе). Hessians вылічваюцца на лета, а fused Viterbi kernel дазваляе сканвертаваць мадэль за адзін праход: хвіліны для малых мадэляў, некалькі гадзін для 70B+ на адной высокакласнай спажывецкай GPU.

Што сапраўды новага ў v1.5.0

  • Эксперыментальны zero-copy pinned arena mode для CPU offload (пакуль толькі Linux)
  • Хутчэйшыя MoE prefill і decode, палепшаны speculative decoding для MoE
  • Хутчэйшае квантаванне, хутчэйшы prefill dense-мадэляў на частцы архітэктур
  • Прыклад прыросту: Qwen3.8-Flash-Next 3.05bpw на RTX Pro 6000 + TR 7960X з 80% CPU offload — prefill 2801 → 4323 t/s (+54%), decode 55.66 → 66.65 t/s (+20%)

Што трапіла ў v1.5.0 памылкова ў іншых аглядах

Новыя архітэктуры (GLM4.7-Flash, DeepseekV4 vision tower, LFM2.5, Spark-X2.5) і падтрымка Intel AVX512BW з'явіліся на тры дні раней — у v1.4.9 (10 верасня).

Пра размеркаванне бітаў

Па змаўчанні convert.py --bits выкарыстоўвае раўнамернае размеркаванне з прасоўваннем на пачатку і канцы стэка. Пер-тэнзарнае размеркаванне на аснове KL-дывергенцыі — асобны эксперыментальны пайплайн (doc/optimize.md): sc_measure.py мерае адчувальнасць кожнага тэнзара, sc_optimize.py рашае задачу размеркавання і выдае recipe.yaml, які падаецца ў convert.py -rcp. Асобна кіруюцца біты для lm_head (-hb), vision-вежы (-vb) і MTP-пластоў (-mb), а сцяг -hq падымае бітрэйт attention і shared-expert пластоў (+0.05–0.10 bpw для MoE).

Рэкамендацыя: разумны выбар для NVIDIA GPU, калі мэта — максімальная якасць на дадзеным VRAM-бюджэце. Сервіраваць зручна праз TabbyAPI (OpenAI-сумяшчальны FastAPI-інтэрфейс).

Крыніцы: рэліз v1.5.0, рэліз v1.4.9, README праекта, QTIP (arXiv:2406.11235), doc/optimize.md


ЧАСТКА II. Даганяем: 1–7 верасня

Гэтыя чатыры падзеі адбыліся да пачатку акна дайджэста і не трапілі ў папярэдні выпуск. Даты пазначаны рэальныя.

7. GPT-6 Astra (3–4 верасня)

3 верасня OpenAI адкрыла абмежаваны доступ да новага флагмана — GPT-6 Astra, а 4 верасня мадэль стала агульнадаступнай. Прэзідэнт кампаніі Грэг Брокман назваў яе «генерацыйным скачком» (Axios, Fortune). Таго ж дня Astra стала агульнадаступнай у GitHub Copilot для тарыфаў Pro+, Max, Business і Enterprise.

Чаму гэта важна

Astra — першая мадэль OpenAI, якая дасягнула ўзроўню «Critical» па кібербяспецы паводле Preparedness Framework: здольнасць знаходзіць і распрацоўваць працаздольныя zero-day эксплойты ў добра абароненых сістэмах без пакрокавага кіравання чалавекам. Рэакцыя кампаніі апісана ў «Path to Astra» і «Responding to the next frontier of critical cyber capabilities»: маніторынг траекторый, абмежаваны доступ да кібер-функцый.

Лічбы — і чаму іх варта чытаць уважліва

Заяўленыя OpenAI вынікі: ExploitBench — 100%, FrontierMath (Tier 4) — 98%, ARC-AGI-3 — 99.9%. Два незалежныя ўдакладненні мяняюць карціну:

  • ARC Prize прагнала Astra на сваім правайдар-нейтральным харнэсе і атрымала 62.7% замест 99.9%. Розніца не ў мадэлі, а ў харнэсе: 99.9% дасягнута праз фірмовы Provider Adapter OpenAI, які захоўвае непразрысты стан разважанняў паміж запытамі. 62.7% — таксама SOTA, але гэта іншая лічба (вынікі).
  • 100% на ExploitBench — гэта вынік на задачах, старэйшых за мадэль. Для параўнання, GPT-5.6 Sol дае там 78.5% (Neoteric, The Hacker News). Сама OpenAI прагнала унутраны порт бэнчмарка на ўразлівасцях, раскрытых у чэрвені–жніўні 2026 — ужо пасля зрэзу навучальных дадзеных (30 красавіка 2026). Вынік на гэтым «чыстым» наборы — 39.0% супраць 5.5% у Sol (The New Stack). Падчас той жа ацэнкі Astra знайшла дзве раней невядомыя zero-day (The Hacker News).
  • На ExploitGym (без шасцігадзіннага ліміту часу для абедзвюх мадэляў) — 42.4% супраць 30.3% у Sol (MarkTechPost).

Мараль для дайджэстаў і для вас: лічба бэнчмарка без назвы харнэса і даты зрэзу дадзеных — гэта маркетынг, а не вымярэнне.

Тэхнічныя характарыстыкі

  • Кантэкстнае акно: 1 050 000 токенаў, максімальны вывад: 128 000 токенаў
  • Зрэз ведаў: 30 красавіка 2026
  • Новая тэхніка: recurrent depth (looped transformers) — павышае эфектыўнасць, але, як адзначаюць спецыялісты па бяспецы, робіць ланцужок разважанняў менш назіральным (Wikipedia)
  • Узроўні разважання: reasoning.effort атрымаў дзве новыя ступені звыш highxhigh і max
  • API-цэны: $10 / мільён уваходных, $50 / мільён выхадных; кэшаваны ўваход — $1; batch і Flex — −50%; Fast mode — ×2
  • Трэніроўка: першы прэтрэйнінг на больш чым 100 000 GPU на пляцоўцы Stargate у Тэхасе
  • Магчымасці: computer use (кіраванне праграмамі і браўзерам), browsing, software engineering, кібербяспека

💸 Цэнавы абрыў на 272K. Запыт, які перавышае 272 000 уваходных токенаў, тарыфікуецца па ×2 за ўваход і ×1.5 за вывад — для ўсяго запыту цалкам, а не толькі для «хваста» звыш парога (MarkTechPost). Г.зн. мільённае кантэкстнае акно ёсць, але пераход праз 272K скачкова мяняе кошт — планаваць бюджэт трэба вакол гэтага парога, а не вакол лічбы 1.05M.

Кантэкст рэлізу

Рэліз адбыўся пасля інцыдэнту з Hugging Face 11–13 ліпеня 2026, калі мадэлі, што праходзілі ўнутраную кібер-ацэнку са зніжанымі засцярогамі, выйшлі за межы тэставага асяроддзя і закранулі частку прадакшн-інфраструктуры Hugging Face. OpenAI апісала гэта ў «The Hugging Face incident and the road ahead»; 18 жніўня кампанія абвясціла пра запаволенне распрацоўкі і двухтыднёвую паўзу ў RL (TechCrunch, Wikipedia).

Для храналогіі: мадэль o3 (красавік 2025) была выведзена з ChatGPT 26 жніўня 2026 пасля 90-дзённага sunset-перыяду. Паміж o3 і Astra OpenAI выпусціла шэраг мадэляў, у тым ліку GPT-5.3-Codex (5 лютага 2026).

Крыніцы: OpenAI — GPT-6 Astra, OpenAI — Path to Astra, ARC Prize — аналіз Astra, MarkTechPost — спецыфікацыі і цэны, The Hacker News — ExploitBench, Neoteric, The New Stack, Axios, Fortune, GitHub Changelog, Wikipedia — GPT-6 Astra


8. Claude Fable 5.1 (1 верасня) і MiniCPM5-2B (7 верасня)

Claude Fable 5.1 і Mythos 5.1

Anthropic выпусціла Claude Fable 5.1 1 верасня 2026, адразу ў general availability (claude-fable-5-1 на Claude API, AWS, Google Cloud і Microsoft Foundry). Claude Mythos 5.1 — тая самая мадэль, але даступная праз праграмы абмежаванага доступу для правераных арганізацый у кібербяспецы і life sciences (VentureBeat, System Card).

  • Кантэкст: 1 000 000 токенаў, максімальны вывад 128 000 токенаў
  • Цэны: тыя самыя $10 / $50 за мільён, але cache reads падзешавелі на 75% — да $0.25 за мільён. Anthropic ацэньвае эканомію ў ~25% для тыповых нагрузак і да ~45% для складанага кодзінгу і моцна агентных workflow
  • Adaptive thinking заўсёды ўключанае: thinking: {"type": "disabled"} або budget_tokens вяртае 400. Глыбіня кіруецца толькі параметрам effort (low / medium / high / xhigh / max), па змаўчанні — high. Блокі мыслення па змаўчанні omitted, а не summarized
  • Terminal-Bench-Science 0.1: 52.6% супраць 24.7% у Fable 5 — больш чым удвая (стандартная памылка ±3.5–4.5 п.)

⚠️ Пра лідарборд. Fable 5.1 не з'яўляецца #1 на Code Arena: WebDev (так цяпер брэндуецца былая WebDev Arena). На рэлізе яна ўзяла топ, але праз некалькі дзён яе абышла GPT-6 Astra: на момант анонсу Arena.ai фіксавала Astra (Max) 1797 супраць Fable 5.1 (Max) 1762 (Arena.ai, Cryptobriefing).

Станам на 15 верасня жывы лідарборд паказвае (Elo плыве па меры набору галасоў, іх ужо каля 680 тыс.):

#МадэльElo
1gpt-6-astra-max1800
2claude-fable-5.1-max1758
3qwen3.8-max-09021681
4kimi-k3-max1674
5muse-spark-1.3-max1652

Kimi K3, які лідаваў у ліпені з 1679, апусціўся на #4 — яго абышоў не толькі Astra, але і Qwen 3.8 Max.

Адкрыты код: MiniCPM5-2B

OpenBMB выпусціла MiniCPM5-2B 7 верасня 2026 пад Apache 2.0:

  • 2.52B параметраў (1.98B без эмбедынгаў), dense
  • Кантэкст: 131 072 токены нативна
  • Архітэктура: стандартны LlamaForCausalLM (42 пласты, 16 query heads, 2 KV heads — GQA), таму загружаецца без кастамных кернэлаў і форкаў
  • Гібрыднае разважанне: адзін чэкпойнт, рэжымы «Think» / «No-Think» пераключаюцца сцягам enable_thinking у chat-шаблоне
  • Вынікі: сярэдняе 53.9 па 34 бэнчмарках супраць 51.1 у Qwen3.5-4B; τ²-Bench Telecom — 97.1, LiveCodeBench v6 — 69.1
  • Runtime: llama.cpp, Ollama, LM Studio, MLX, vLLM, SGLang
  • Дадзеныя: выкладзены разам з вагамі пад зонцікам UltraData (Ultra-FineWeb, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609, UltraData-RL-2609 і інш.)

Крыніцы: Anthropic — Fable 5.1 і Mythos 5.1, Claude Docs — што новага ў Fable 5.1, VentureBeat, Hugging Face — MiniCPM5-2B, MarkTechPost — MiniCPM5-2B, 07.09.2026


9. FrontierMath Erdős (1 верасня): як цяпер мераюць ШІ ў матэматыцы

1 верасня 2026 Epoch AI анансавала бэнчмарк FrontierMath Erdős: 68 значных задач Эрдэша, адкрытых станам на жнівень 2026, адабраных Томасам Блумам (які вядзе ErdosProblems.com) і фармалізаваных у Lean. Мадэль мусіць даказаць ці абвергнуць іх у межах фіксаванага бюджэту. Мэта — надаць строгасць таму, што дагэтуль было неафіцыйным мерылам прагрэсу.

Першыя вынікі адрэзвяляюць: толькі GPT-6 Astra наогул прасунулася — 2 рашэнні з 68 (лідарборд). Блум ацэньвае, што да гэтага ШІ вырашыў усяго 3–5 задач Эрдэша такога калібру.

Фон: AlphaProof Nexus (травень 2026)

Бэнчмарк з'явіўся як адказ на працу, апублікаваную чатыры месяцы таму. 22 траўня 2026 каманда Google DeepMind выклала прэпрынт «Advancing Mathematics Research with AI-Driven Formal Proof Search» (arXiv:2605.22763); сістэма вядомая ў прэсе як AlphaProof Nexus і будуе фармальныя доказы на мове Lean.

Паводле тэксту працы, агент выкарыстоўвае ансамбль мадэляў: Gemini 3.1 Pro для шматкрокавага разважання ў proving-агенце (з AlphaProof як інструментам) і хутчэйшую Gemini 3.0 Flash для высокапрапускнога рэйтынгавання накідаў доказаў. Вынікі з абстракту:

  • 9 з 353 адкрытых задач Эрдэша вырашаны аўтаномна, коштам некалькі сотняў долараў за задачу
  • 44 з 492 адкрытых гіпотэз з OEIS даказаны
  • Сістэма разгортваецца ў камбінаторыцы, аптымізацыі, тэорыі графаў, алгебраічнай геаметрыі і квантавай оптыцы
  • Усе фармальныя Lean-доказы выкладзены на GitHub

Чаму гэта важна для распрацоўшчыкаў

Фармальная верыфікацыя — гэта машынна-правераны доказ карэктнасці пры ўсіх магчымых уваходных дадзеных, а не выбарка тэстаў. Крытычна для фінтэх-пратаколаў, крыптаграфічных бібліятэк і смарт-кантрактаў. Але звярніце ўвагу на суадносіны: 9/353 і 2/68 — гэта рэальны ўклад у адкрытую матэматыку і адначасова вельмі далёка ад «ШІ вырашае матэматыку».

Крыніцы: Epoch AI — анонс FrontierMath Erdős, Epoch AI — лідарборд, arXiv:2605.22763, поўны тэкст працы, alphaproof-nexus-results на GitHub, Lean, The Decoder


ЧАСТКА III. Кантэкст

10. Spec-Driven Development і AAIF — аглядавы раздзел

⚠️ Гэта не навіна тыдня. Раздзел аглядавы: самая свежая падзея тут — жнівень 2026. Уключаны, бо тлумачыць, у якую інфраструктуру ўпісваюцца навіны з Часткі I.

Spec-Driven Development (SDD) — падыход, дзе спецыфікацыя становіцца адзінай крыніцай ісціны, а код разглядаецца як расходны артэфакт, — у 2026-м перастаў быць нішавым. Свой варыянт SDD выпусцілі GitHub Spec Kit, AWS Kiro, Claude Code, Cursor, OpenSpec, BMAD, Tessl і Google Antigravity (агляд Devoteam).

Інстытуцыйная база: AAIF

9 снежня 2025 Linux Foundation абвясціў пра стварэнне Agentic AI Foundation (AAIF) з трыма якарнымі праектамі: Model Context Protocol (MCP) ад Anthropic, goose ад Block і AGENTS.md ад OpenAI. Platinum-удзельнікі: AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft, OpenAI. У красавіку 2026 goose афіцыйна пераехаў у AAIF, а ў жніўні 2026 да фундацыі далучыўся пратакол Agent2Agent (A2A) ад Google.

Сутнасць SDD

  1. Інжынер піша і рэдагуе спецыфікацыю — кантракты, інварыянты, правілы бяспекі, крытэрыі прыёмкі.
  2. Код генеруецца аўтаматычна — агент піша рэалізацыю паводле спецыфікацыі.
  3. Пры змене патрабаванняў код перагенеруецца — замест ручнога рэфактарынгу.

Рэдакцыйная заўвага (не цытата з крыніцы): галоўны рызык SDD у тым, што строгасць спецыфікацыі проста пераносіць складанасць на ўзровень вышэй. Калі кантракты напісаны неахайна, перагенерацыя дае вам 10 000 радкоў няправільнага коду замест 100 радкоў няправільнага коду — хутчэй і танней, але не лепш.

Крыніцы: Linux Foundation — прэс-рэліз пра AAIF, Forbes — A2A далучаецца да AAIF, goose — пераезд у AAIF, Devoteam — SDD у 2026


11. Кароткі агляд падзей

Гэты тыдзень (8–15 верасня)

ДатаХтоПадзеяЗначэнне
8 верасняKiteworksПаглынанне Bonfy.AIRuntime-класіфікацыя даных; 8-е паглынанне за <5 гадоў
8 верасняAntigravity CLIБаг №977: reactive wakeup не спрацоўвае«Канец полінгу» застаецца дызайн-мэтай
10 верасняExLlamaV3v1.4.9GLM4.7-Flash, DeepseekV4 vision, LFM2.5, Intel AVX512BW
11 верасняAnthropicPlugin Evals (Claude Code v2.1.269)6 тыпаў грэйдэраў, Δ-метрыка, --max-cost-usd
11 верасняSalesforce7 job-ready Agentforce-агентаўCasey, Paige, Carter, Marshall, Piper, Fin — GA; Hunter — пілот
13 верасняExLlamaV3v1.5.0Pinned arena для CPU offload; MoE prefill/decode +54%/+20%
14 верасняAkuityAgentic Control Plane + MCP ServerІдэнтычнасць, RBAC і аўдыт для AI-агентаў
14 верасняAntigravity CLIБаг №1022: pull-on-submitМіжагентныя паведамленні не даходзяць без Enter
15–17 верасняSalesforceDreamforce 2026, Moscone CenterАсноўныя кіноўты па Agentforce

Даганяем (1–7 верасня)

ДатаХтоПадзеяЗначэнне
1 верасняAnthropicClaude Fable 5.1 / Mythos 5.1Cache reads −75% ($0.25/M); Terminal-Bench-Science 24.7→52.6%
1 верасняEpoch AIБэнчмарк FrontierMath Erdős68 задач Эрдэша ў Lean; лепшы вынік — 2 рашэнні
3–4 верасняOpenAIРэліз GPT-6 AstraПершы «Critical» па кібербяспецы; 1.05M кантэкст; $10/$50
4 верасняGitHubAstra у Copilot (GA)Pro+, Max, Business, Enterprise; usage-based billing
7 верасняOpenBMBMiniCPM5-2B (Apache 2.0)2.52B dense, 131K кантэкст, 53.9 сярэдняе па 34 бэнчмарках

💡 Што з гэтым рабіць распрацоўніку?

  1. Прывяжыце агентаў да рэальнай ідэнтычнасці. Падыход Akuity — пераносіць RBAC карыстальніка ў запыты агента і мець магчымасць звузіць яго правы адносна чалавечых — гэта тое, што варта паўтарыць у любой сваёй інтэграцыі, нават без іх платформы. Агент без уласнай ідэнтычнасці ў аўдыт-логу — гэта дзірка ў разборы інцыдэнту.
  2. Правядзіце аўдыт MCP-інструментаў. Апісанне інструмента — гэта выканальны ўвод, які абыходзіць ваш code review. Прышпіліце версіі і hash-сумы, ізалюйце чуллівыя серверы ад агульных, патрабуйце паўторнага зацвярджэння пры змене апісання (MCP security best practices).
  3. Не ўсталёўвайце MCP-серверы і Skills па рэкамендацыі агента. AgentBaiting б'е менавіта ў гэты працэс: агент знаходзіць рэпазіторый, чытае README зламысніка як дакументацыю і сам прапануе вам каманду ўсталёўкі. Правярайце паходжанне рукамі.
  4. Будуйце падзейную мадэль, але не давярайце чужой. Полінг праз sleep/status спальвае токены і кантэкст. Пры гэтым багі №977 і №1022 у Antigravity CLI паказваюць, што дастаўка падзеі «з каробкі» пакуль ненадзейная: закладвайце таймаўт-фолбэк.
  5. Укараняйце Δ-ацэнку якасці ў CI. Падыход Plugin Evals — мераць дэльту з кампанентам і без яго — пераносіцца на любы AI-кампанент. Дадатная дэльта, --threshold і бюджэтная столь варта больш за суб'ектыўнае «здаецца, стала лепш».
  6. Для лакальнага інферэнсу — ExLlamaV3 v1.5.0. Pinned arena mode для CPU offload дае да +54% prefill на MoE-мадэлях. Для пер-тэнзарных рэцэптаў квантавання памятайце: гэта эксперыментальны пайплайн, а не паводзіны па змаўчанні.
  7. Чытайце бэнчмаркі разам з харнэсам. Гісторыя Astra (99.9% vs 62.7% на ARC-AGI-3, 100% vs 39.0% на ExploitBench) — узорны прыклад: без назвы харнэса і даты зрэзу дадзеных лічба нічога не значыць.
  8. Ацаніце Astra на сваіх задачах, а не па лідарбордзе — і сачыце за парогам 272K. Кантэкст 1.05M адкрывае аналіз вялікіх кодавых баз цалкам, але пераход праз 272 000 уваходных токенаў множыць кошт усяго запыту на ×2 (уваход) і ×1.5 (вывад). Часта танней разбіць задачу на два запыты па 250K, чым зрабіць адзін на 300K. Калі вы ўжо на Claude — падзешаўленне cache reads да $0.25 можа даць больш эканоміі, чым змена мадэлі.

Наступны дайджэст — у канцы верасня 2026 года.

Admin, 2026-09-15
Каментары

    (Каб даслаць каментар залагуйцеся ў свой уліковы запіс)