Ship It With AI Mihai Cvasnievschi

Anexa C - Surse și lecturi suplimentare

39 min de citit

Anexa asta există pentru că fiecare afirmație din manual merită o sursă verificabilă, dacă vrei să mergi pe fir până la capăt. Am organizat intrările după afirmație, nu după sursă, ca să poți porni de la un pasaj din corpul cărții și să ajungi la dovezile din spatele lui. Intrările sunt grupate pe categorii (studii, incidente cunoscute, vulnerabilități cu versiuni de patch, documentația tool-urilor, marketplace-uri, surse pentru componenta principală Memory, surse pentru componenta principală Permisiuni / Sandbox, surse despre bucla exterioară și autonomie, surse despre harness și migrarea între modele), iar fiecare intrare are aceeași formă: afirmația, sursa, unde anume e folosită în manual și orice avertisment care merită știut.

Studii și cercetare

Studiu
Afirmația
Dezvoltatorii open-source experimentați care au folosit asistență AI pe repo-uri pe care le cunoșteau bine au fost cu 19% mai lenți decât aceiași dezvoltatori fără ea, deși estimaseră în prealabil că vor fi cu 24% mai rapizi - un decalaj de 43 de puncte între accelerarea așteptată și încetinirea măsurată, care a persistat în auto-evaluările lor chiar și după ce datele i-au contrazis.
Sursa
Becker et al., METR, "Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity," July 10, 2025. arXiv: arxiv.org/abs/2507.09089. Articol: metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/. Schimbarea de design a follow-up-ului: metr.org/blog/2026-02-24-uplift-update/.
Unde e folosită
Capitolul 4 (De la cod generat la software livrat).
Atenție
Studiul a testat asistența AI brută (Cursor + Claude), fără o variabilă pentru disciplina formulării. Interpretarea că disciplina de workflow e variabila lipsă îmi aparține mie, nu studiului. Follow-up-ul METR de la sfârșitul lui 2025 a suferit un selection bias sever (dezvoltatorii refuzau tot mai des randomizarea fără AI) și a produs doar estimări slabe; METR a anunțat un experiment reproiectat pe 24 februarie 2026 și avertizează împotriva extrapolării cifrei de 19% la tool-urile actuale.

Incidente cunoscute

Incident
Afirmația
Pe 24 aprilie 2026, PocketOS și-a pierdut baza de date de producție în nouă secunde, când un agent Cursor bazat pe Claude Opus 4.6 a invocat Volume Delete de la Railway printr-un API token găsit pe parcurs, în timpul unei încercări de recuperare după o nepotrivire de credențiale. Backup-urile, stocate pe același volum, au fost distruse odată cu datele primare.
Sursa
Reported by DevOps.com ("When AI Goes Really, Really Wrong"), Business Insider (Jer Crane statement), and others. Anthropic's Claude Opus 4.6 system card (February 2026) describes the model that powered the agent.
Unde e folosită
Prolog (Nouă secunde) și Capitolul 3 (Guvernanța în straturi).
Atenție
Cronologia recuperării diferă între relatările publice - restore-ul făcut de Railway ar fi durat ~30 de minute după ce Crane i-a contactat, în timp ce alte relatări vorbesc de ~30 de ore sau două zile până la restaurarea operațională completă. Folosesc incidentul pentru pattern-ul de guvernanță, nu ca reconstituire criminalistică exactă. Urmarea: pe 29 aprilie 2026, Railway a anunțat că toate ștergerile de volume și resurse - până atunci instantanee când erau invocate prin API - fac acum soft-delete cu o fereastră de recuperare de 48 de ore, alături de guardrails la nivel de workspace și acces de agent cu scop limitat (blog.railway.com/p/your-ai-wants-to-nuke-your-database).
Incident
Afirmația
La sfârșitul lui februarie 2026, Alexey Grigorev de la DataTalks.Club a pierdut doi ani și jumătate de infrastructură de cursuri, când Claude Code a lucrat pe un state file Terraform rămas în urmă și a rulat terraform destroy peste ce a interpretat el drept resurse orfane.
Sursa
Public account by Alexey Grigorev (DataTalks.Club), late February 2026.
Unde e folosită
Capitolul 3 (Guvernanța în straturi).
Atenție
Pierderea de date a fost parțială; AWS a restaurat aproximativ 1,94 milioane de rânduri dintr-un snapshot, în circa o zi. Incidentul e documentat public, dar cu mai puțină acoperire decât PocketOS. Follow-up-ul lui Grigorev documentează întărirea adoptată după: delete protection și în Terraform, și în AWS, starea mutată în S3, review manual al fiecărui plan distructiv și un tier de suport AWS mai ridicat.
Incident
Afirmația
Post-mortem-ul tehnic al Anthropic din 23 aprilie 2026 („An update on recent Claude Code quality reports”) a recunoscut trei regresii: effort-ul implicit de reasoning coborât de la high la medium pe 4 martie (revenit pe 7 aprilie), un bug de caching din 26 martie care golea istoricul de raționament la fiecare tur în loc de o dată pe oră de inactivitate (reparat pe 10 aprilie, v2.1.101) și un plafon de verbozitate în system prompt din 16 aprilie, care a produs o scădere măsurată de ~3% a calității (revenit pe 20 aprilie). Separat și mai devreme, Stella Laurenzo, Senior Director la AMD, a publicat un audit independent (6 aprilie, depus ca issue GitHub anthropics/claude-code#42796) pe 6.852 de sesiuni Claude Code și 234.760 de tool call-uri, care arăta trecerea de la un comportament research-first la unul edit-first pe măsură ce ascunderea thinking-ului a crescut de la 1,5% la 100% dintre tururi, atribuind degradarea în parte rollout-ului din februarie al lui adaptive thinking activat implicit.
Sursa
Post-mortem-ul de engineering Anthropic, 23 aprilie 2026: anthropic.com/engineering/april-23-postmortem. Auditul Laurenzo: issue-ul GitHub anthropics/claude-code#42796; acoperire în The Register, 6 aprilie 2026.
Unde e folosită
Capitolul 4 (De la cod generat la software livrat).
Atenție
Atribuirea către rollout-ul de adaptive thinking din februarie îi aparține lui Laurenzo, nu vendorului; cele trei cauze recunoscute de post-mortem încep în martie. Cele două relatări coincid pe regresii și diverg pe cauza cea mai timpurie.

Vulnerabilități cu versiuni de patch

Vulnerabilitate
Afirmația
Claude Code era vulnerabil la remote code execution prin fișiere de proiect din surse nesigure: fișiere .mcp.json sau .claude/settings.json malițioase, din repo-uri în care nu aveai încredere, puteau executa hook-uri înainte de dialogul de trust, deschizând calea spre RCE.
Sursa
Check Point Research, February 2026. CVE-2025-59536. NVD: nvd.nist.gov/vuln/detail/CVE-2025-59536. Articol: research.checkpoint.com/2026/rce-and-api-token-exfiltration-through-claude-code-project-files-cve-2025-59536/.
Unde e folosită
Capitolul 3 (Guvernanța în straturi); menționată și în Capitolul 10 (Adopția, scena cu comitetul de securitate).
Atenție
Dezvăluită și patch-uită în Claude Code v1.0.111 (octombrie 2025); articolul Check Point a apărut în februarie 2026. Versiunile dinaintea patch-ului rămân vulnerabile; clasa de probleme supraviețuiește chiar și după patch-ul specific.
Vulnerabilitate
Afirmația
Claude Code era vulnerabil la exfiltrarea de API key-uri prin injecție de configurație: setări controlate de atacator, care suprascriau ANTHROPIC_BASE_URL înainte de promptul de trust, puteau scurge API key-urile.
Sursa
Check Point Research, February 2026. CVE-2026-21852.
Unde e folosită
Capitolul 3 (Guvernanța în straturi).
Atenție
Patch-uită în Claude Code v2.0.65. Aceeași clasă ca CVE-2025-59536: execuția configurației de proiect nesigure înainte de trust.
Vulnerabilitate
Afirmația
Claude Code încarcă automat fișierele .env* din directorul de lucru la începutul sesiunii, fără permisiunea explicită a utilizatorului, expunând secretele în contextul agentului.
Sursa
Knostic, December 2025. Blog: knostic.ai/blog/claude-loads-secrets-without-permission.
Unde e folosită
Capitolul 3 (Guvernanța în straturi), numită în clasa de vulnerabilități de auto-încărcare a fișierelor dot-env.
Atenție
Mitigarea e un denyRead în sandbox pe pattern-urile .env*, nu un patch de la vendor; în iunie 2026, Claude Code a adăugat o setare opt-in sandbox.credentials, care blochează comenzile din sandbox de la citirea fișierelor de credențiale și a variabilelor de mediu secrete - un control mai țintit pentru aceeași clasă, tot opt-in, nu implicit. Comportamentul se poate schimba în versiunile viitoare; clasa de probleme (agenți care încarcă config local la începutul sesiunii) rămâne valabilă.
Vulnerabilitate
Afirmația
Regulile de deny din Claude Code erau ocolite în tăcere atunci când o comandă de shell înlănțuia mai mult de 50 de subcomenzi (plafon dur MAX_SUBCOMMANDS_FOR_SECURITY_CHECK = 50), verificarea de securitate retrogradând la un prompt generic de "ask".
Sursa
Adversa AI Red Team, disclosed April 1, 2026. Articol: adversa.ai/blog/claude-code-security-bypass-deny-rules-disabled/.
Unde e folosită
Capitolul 3 (Guvernanța în straturi), ca exemplul de bypass prin plafonul parserului pentru ideea că "orice strat luat individual poate avea un mod de eșec silențios".
Atenție
Patch-uită în Claude Code v2.1.90 în primele zile ale lui aprilie 2026 - writeup-ul Adversa consemnează fix-ul până pe 4 aprilie, la câteva zile de la dezvăluire. Clasa - straturi de guvernanță cu plafoane de parser care cedează în tăcere - e ce trebuie să-ți rămână în minte după ce plafonul specific dispare.
Vulnerabilitate
Afirmația
Parserele de permisiuni din coding agents recunosc doar un set cunoscut de comenzi de shell pentru citit fișiere; agenții care invocă open() din Python, fs.readFile din Node sau orice binar nerecunoscut ocolesc complet regulile de deny.
Sursa
Adam Kinney, April 2026. Articol: Claude Code's Deny Rules Don't Protect You - Here's What Actually Does.
Unde e folosită
Capitolul 3 (Guvernanța în straturi), ca o clasă de bypass al parserului de permisiuni.
Atenție
Problemă arhitecturală, nu un CVE punctual. Mitigarea e lista denyRead din sandbox-ul de la nivel de OS (la nivel de kernel), nu un patch de la vendor. Clasa persistă de la un patch la altul, pentru că parserul nu poate enumera fiecare binar existent.
Vulnerabilitate
Afirmația
Două vulnerabilități zero-click de prompt injection în sandbox-ul Cursor - CVE-2026-50548 și CVE-2026-50549 (CVSS 9.8, botezate „DuneSlide”) - abuzau allowlist-ul de scriere pe directorul de lucru și un fallback de rezolvare a symlink-urilor ca să evadeze din sandbox și să ajungă la remote code execution la nivel de OS. Toate versiunile dinainte de Cursor 3.0 (2 aprilie 2026) erau afectate; 3.0 le-a reparat pe ambele.
Sursa
Cato Networks (Cato AI Labs), dezvăluite la mijlocul lui 2026. Writeup: catonetworks.com/blog/duneslide-two-critical-rce-vulnerabilities/; acoperire: SecurityWeek, The Hacker News, iulie 2026.
Unde e folosită
Capitolul 3 (Guvernanța în straturi, stratul doi).
Atenție
Lecția e clasa, nu vendorul: și cel mai puternic strat poate avea bug-uri - exact de-asta straturile sunt cinci, nu unul.
Vulnerabilitate
Afirmația
Cercetătorii Mozilla 0Din au demonstrat (iunie 2026) un atac de prompt injection indirect în care un repository cu aspect inofensiv determină Claude Code să ruleze un script care își trage un payload codat base64 dintr-un DNS TXT record și deschide un reverse shell - atacul e împărțit între repository, DNS și mașina developerului, așa că nicio semnătură de reverse shell nu apare în clar pe disc sau pe fir.
Sursa
SecurityWeek, 29 iunie 2026: securityweek.com/new-attack-abuses-claude-code-and-harmless-looking-repositories-to-hijack-developer-machines/.
Unde e folosită
Capitolul 3 (Guvernanța în straturi, injecția prin munca în sine).
Atenție
Proof of concept; niciun patch de vendor raportat la momentul scrierii. Mitigarea e postura stratificată - un allowlist de rețea mărginește calea prin DNS indiferent de ce a fost convins agentul să ruleze.

Documentația tool-urilor

Documentație
Afirmația
Codex CLI a livrat Agent Skills ca componentă principală de primă clasă în decembrie 2025, cu fișiere SKILL.md cu frontmatter YAML și semantici de progressive disclosure comparabile cu Skills din Claude Code.
Sursa
OpenAI Codex CLI docs, developers.openai.com/codex/skills.
Unde e folosită
Capitolul 1 (Componentele principale), ca partea Codex a convergenței pe componenta principală de skill.
Atenție
Documentație de vendor; datele de GA sunt corecte la mijlocul lui 2026, dar pot fi revizuite retroactiv.
Documentație
Afirmația
Subagenții din Codex CLI au ajuns la GA pe 14 martie 2026 și rulează până la șase în paralel by default (agents.max_threads, implicit 6; adâncimea de nesting e implicit un singur nivel).
Sursa
OpenAI Codex CLI docs, developers.openai.com/codex/subagents.
Unde e folosită
Capitolul 1 (Componentele principale) și Capitolul 5 (Bucla în șase faze, faza de Execute).
Atenție
Documentație de vendor; default-ul de șase thread-uri e în practică un plafon la mijlocul lui 2026 (openai/codex#11965 urmărește configurabilitatea lui) și se poate schimba în versiunile următoare.
Documentație
Afirmația
Codex CLI documentează AGENTS.md drept convenția pentru instrucțiuni de agent la nivel de proiect, încărcată la începutul sesiunii și echivalentă ca rol cu fișierele de instrucțiuni de echipă ale celorlalți vendori.
Sursa
OpenAI Codex CLI documentation, developers.openai.com/codex/agents-md.
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea despre skills) și Capitolul 6 (AGENTS.md ca infrastructură de echipă).
Atenție
Numele fișierului și semantica de încărcare sunt stabile; regulile specifice de frontmatter și de descoperire pot evolua de la o versiune la alta.
Documentație
Afirmația
AGENTS.md, în calitate de convenție neutră față de vendor pentru fișierul de instrucțiuni al echipei, are suport nativ în Codex CLI, Cursor, GitHub Copilot, Gemini CLI, Aider, Zed și Windsurf. Formatul e markdown; semantica de încărcare e echivalentă între tool-uri.
Sursa
Cross-vendor documentation: Codex CLI (developers.openai.com/codex/agents-md), Cursor (cursor.sh/docs), GitHub Copilot (docs.github.com/copilot), Gemini CLI (cloud.google.com/gemini/docs/codeassist), Aider (aider.chat/docs), Zed (zed.dev/docs/ai), Windsurf (codeium.com/windsurf/docs).
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea despre skills) și Capitolul 6 (Nume și convenții).
Atenție
Lista tool-urilor care îl suportă crește în timp; afirmația e că AGENTS.md e convenția de facto neutră față de vendor, nu că lista ar fi exhaustivă. Lista se și schimbă: Google a început la mijlocul lui 2026 tranziția utilizatorilor de Gemini CLI către Antigravity CLI (tier-urile gratuite și de consumator au încetat să fie servite în iunie) - iar succesorul citește același AGENTS.md, adică exact convenția care supraviețuiește tool-ului, adică exact poanta acestei intrări.
Documentație
Afirmația
opencode e un coding agent open-source întreținut de o echipă independentă, scris în TypeScript și licențiat sub MIT. Codul sursă e organizat în jurul acelorași componente principale pe care manualul ăsta le identifică în Codex CLI și Claude Code.
Sursa
opencode repository (github.com/anomalyco/opencode; fost sst/opencode - compania care îl întreține s-a redenumit Anomaly în ianuarie 2026); LICENSE and README.
Unde e folosită
Capitolul 1 (Componentele principale, trecerea în revistă a codului sursă) și Capitolul 2 (Anatomia invariantă, demo-ul cu doi agenți).
Atenție
Numele proiectului și componența echipei de mentenanță pot evolua; afirmația despre convergența arhitecturală supraviețuiește redenumirilor.
Documentație
Afirmația
Playwright controlează un browser real prin interacțiuni scriptate; accessibility tree-ul e structura semantică pe care browserele o expun pentru tehnologiile asistive și rămâne stabil la restilizări vizuale sau la schimbarea bibliotecii de componente. Testele scrise pe accessibility tree verifică comportamentul, nu prezentarea.
Sursa
Playwright documentation (playwright.dev/docs/accessibility-testing); W3C ARIA Accessibility Object Model spec.
Unde e folosită
Capitolul 5 (faza de Verify), ca pattern recomandat de verificare a frontend-ului; checklist-ul din Anexa B.3.
Atenție
O parte din comportamentul UI-ului (animații, drag-and-drop, suprafețe canvas complexe) nu e surprinsă complet de accessibility tree și are nevoie de verificare suplimentară.
Documentație
Afirmația
Claude Code suportă sandboxing la nivel de OS pe Linux (bubblewrap cu Landlock și seccomp), macOS (Seatbelt) și Windows (restricted tokens cu job objects), activabil opt-in prin configurare. Codex CLI impune sandbox-ul implicit pe Linux și macOS; trebuie să faci opt-out, nu opt-in.
Sursa
Claude Code docs (code.claude.com/docs/en/sandboxing) and Codex CLI agent approvals and security docs (developers.openai.com/codex/agent-approvals-security).
Unde e folosită
Capitolul 2 (Anatomia invariantă, constatarea despre divergența de sandbox) și Capitolul 3 (Guvernanța în straturi, stratul doi).
Atenție
"Activat implicit" versus "opt-in" e un detaliu de implementare care ține de versiune. Verifică default-ul curent pentru versiunea pe care o ai instalată înainte să te bazezi pe el.
Documentație
Afirmația
Cursor 2.0 (octombrie 2025) a introdus agenți paraleli independenți și sandboxing activat implicit pe macOS; sistemul de subagenți propriu-zis - un agent părinte care deleagă către subagenți copii - a apărut în Cursor 2.4 (ianuarie 2026) și a devenit asincron în 2.5. Cline a livrat subagenți nativ. Claude Code a adăugat Agent Teams ca strat de coordonare de nivel mai înalt peste tool-ul Task.
Sursa
Changelog-urile Cursor (2.0, 2.4, 2.5); anunțurile și documentația vendorilor pentru Cline și Claude Code; colatate de-a lungul lui 2026.
Unde e folosită
Capitolul 1 (Componentele principale), ca dovadă pentru convergența pe componenta principală de subagent în aproximativ un an.
Atenție
Suprafețele de produs ale vendorilor evoluează; afirmația despre convergență rămâne în picioare chiar și când nume specifice de produs se rebranduiesc.
Documentație
Afirmația
Claude Fable 5, lansat pe 9 iunie 2026 ca primul model din clasa Mythos, a avut accesul suspendat la nivel mondial între 12 și 30 iunie 2026, înainte de a fi redistribuit.
Sursa
Anthropic, „Claude Fable 5 and Mythos 5” (9 iunie 2026): anthropic.com/news/claude-fable-5-mythos-5; „Redeploying Fable 5” (30 iunie 2026): anthropic.com/news/redeploying-fable-5.
Unde e folosită
Capitolul 10 (Vendorul va avea o săptămână proastă).
Atenție
Motivul suspendării e relatarea vendorului; lecția operațională - planifică pentru indisponibilitatea vendorului - nu depinde de cauză.
Documentație
Afirmația
Ghidul de teren din iulie 2026 al unui inginer Anthropic descrie Claude Fable 5 ca „primul model la care calitatea muncii are ca bottleneck capacitatea mea de a-i clarifica necunoscutele” și organizează metoda de lucru în jurul a patru tipuri de necunoscute, cu tehnici precum blind spot pass-ul, fișierele de note de implementare și quiz-urile de comprehensiune.
Sursa
Thariq Shihipar, „A field guide to Claude Fable 5: Finding your unknowns”, blogul Anthropic, 6 iulie 2026: claude.com/blog/a-field-guide-to-claude-fable-finding-your-unknowns.
Unde e folosită
Capitolul 4 (bottleneck-ul de formulare, coroborat din interiorul vendorului) și Capitolul 5 (blind spot pass în Research, notele de implementare în Execute, quiz-ul în citirea diff-ului de agent).
Atenție
Relatarea unui singur practician, publicată de vendor despre propriul model. Tehnicile stau în picioare singure; superlativul „primul model” e judecata autorului, nu o măsurătoare.

Marketplace-uri și ecosisteme de plugin-uri

Marketplace
Afirmația
Marketplace-ul claude-plugins-official al Anthropic vine inclus în Claude Code din mai 2026 și împachetează skill-uri, hook-uri, tool-uri și comenzi în spatele unei singure comenzi de instalare. Marketplace-ul avertizează utilizatorii să verifice dacă au încredere în plugin-uri înainte să le instaleze.
Sursa
Claude Code docs (code.claude.com/docs/en/discover-plugins); the marketplace itself.
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea despre plugin-uri).
Atenție
Numărul de plugin-uri și politicile marketplace-ului se vor schimba în timp; ce trebuie să iei cu tine e disciplina de supply chain descrisă în Capitolul 1, nu vreun număr anume.

Surse pentru componenta principală Memory

Componenta principală Memory
Afirmația
AGENTS.md e citit la începutul sesiunii de Codex CLI, Cursor, GitHub Copilot, Gemini CLI, Aider și de ecosistemul mai larg de coding agents open-source (peste 20 de vendori listați pe agents.md la 2026-05). Claude Code citește CLAUDE.md, care poate importa AGENTS.md pentru a împărți același conținut cu ceilalți agenți. Convergența plasează AGENTS.md în stratul de memorie definită manual al componentei principale Memory numit în Capitolul 1.
Sursa
agents.md (the open standard's site), plus vendor documentation for each agent listed.
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea Memory) și Capitolul 6 (AGENTS.md ca infrastructură de echipă).
Atenție
Numele exact al fișierului și semantica de încărcare diferă de la un vendor la altul - Claude Code citește CLAUDE.md (importabil din AGENTS.md prin @AGENTS.md sau symlink); Cursor citește AGENTS.md plus .cursorrules. Convergența e pe rolul structural - scris de utilizator, încărcat mereu, partajabil în echipă - nu pe un format de fișier identic la nivel de byte.
Componenta principală Memory
Afirmația
Claude Code întreține un strat de auto-memory în care Claude își scrie singur notițe de la o sesiune la alta - comenzi de build pe care le-a deslușit, concluzii de debugging pe care le-a confirmat, preferințe de stil de cod pe care le-a dedus - distinct de CLAUDE.md-ul scris de utilizator. Necesită Claude Code v2.1.59+; activat implicit; stocare per repo.
Sursa
code.claude.com/docs/en/memory.
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea Memory).
Atenție
Intrarea documentează implementarea din Claude Code, dar jumătatea asta e o convergență, nu o exclusivitate: GitHub Copilot Memory a ajuns în public preview pe 15 ianuarie 2026 - înainte să apară Auto Memory - și era activat implicit pe tier-urile Pro până pe 4 martie; Codex CLI a adăugat memorie automată de fundal în aprilie 2026.
Componenta principală Memory
Afirmația
Anthropic a anunțat public Dreaming ca parte din Claude Managed Agents la Code with Claude SF pe 2026-05-06 - un proces de fundal programat, care trece în revistă sesiunile recente și memory store-ul, identifică greșelile recurente și workflow-urile convergente și scrie notițe consolidate înapoi în memoria pe termen lung. Se livrează ca feature la nivel de platformă, condiționat de un beta header; o suprafață în CLI-ul Claude Code (/dream) era doar sugerată în produs și nu apăruse ca o comandă funcțională până în iulie 2026.
Sursa
Code with Claude SF announcement, 2026-05-06; code.claude.com/docs/en/memory.
Unde e folosită
Capitolul 1 (Componentele principale, secțiunea Memory).
Atenție
Dreaming e specific Anthropic și la nivel de API la data publicării, nu încă un feature de CLI. Manualul ăsta indexează rolul structural, nu vendorul.

Surse pentru componenta principală Permisiuni / Sandbox

Componenta principală Permisiuni / Sandbox
Afirmația
Claude Code vine cu un model de permisiuni Allow/Ask/Deny, cu precedență deny-apoi-ask-apoi-allow, și cu un sandbox de OS opt-in - Seatbelt pe macOS, bubblewrap pe Linux - configurabil prin /sandbox și prin .claude/settings.json la nivel de proiect. Stratul de decizie e activ implicit; sandbox-ul de OS nu.
Sursa
code.claude.com/docs/en/permissions; code.claude.com/docs/en/sandboxing.
Unde e folosită
Capitolul 1 (secțiunea Permisiuni / Sandbox), Capitolul 3 (stratul unu și stratul doi).
Atenție
Postură opt-in pe jumătatea de enforcement la nivel de OS. O instalare standard de Claude Code are stratul de decizie, dar niciun sandbox la nivel de kernel; majoritatea instalărilor sar peste pasul de configurare a sandbox-ului.
Componenta principală Permisiuni / Sandbox
Afirmația
Codex CLI impune implicit sandbox la nivel de OS pe Linux (Landlock + seccomp prin bwrap) și pe macOS (Seatbelt); pe Windows folosește restricted tokens plus izolare bazată pe ACL-uri. Stratul de decizie e livrat în paralel, ca gate de aprobare per tool.
Sursa
developers.openai.com/codex/concepts/sandboxing; developers.openai.com/codex/agent-approvals-security.
Unde e folosită
Capitolul 1 (secțiunea Permisiuni / Sandbox), Capitolul 2 (constatarea din comparația arhitecturală cap la cap), Capitolul 3 (stratul doi).
Atenție
Postură opt-out - poți configura Codex să ruleze fără sandbox, dar default-ul inversează convenția, de la "oprit dacă nu-l configurezi" la "pornit dacă nu-l dezactivezi". Implementarea pe Windows e cea mai puțin uniformă dintre agenții majori.
Componenta principală Permisiuni / Sandbox
Afirmația
opencode vine cu un model de prompt de permisiuni în interiorul agentului și cu validare de căi și permisiuni, dar nu oferă izolare prin sandbox la nivel de OS; pentru izolare, operatorul trebuie să împacheteze opencode în Docker, într-un microVM sau într-un alt harness de sandbox (KB-ul Vercel documentează explicit acest pattern de deployment). La testul de convergență din Capitolul 1, opencode trece jumătatea cu stratul de decizie și pică jumătatea cu enforcement-ul la nivel de OS.
Sursa
vercel.com/kb/guide/running-opencode-securely-with-the-vercel-sandbox.
Unde e folosită
Capitolul 1 (secțiunea Permisiuni / Sandbox), Capitolul 2 (constatarea din comparația arhitecturală cap la cap).
Atenție
Eticheta de "îngrădire soft" îi aparține manualului, nu documentației opencode. opencode nu pretinde că livrează un sandbox - absența e asumată onest, nu ascunsă.

Surse despre bucla exterioară și autonomie

Bucla exterioară
Afirmația
Până în primăvara lui 2026, bucla exterioară devine o suprafață de primă clasă în Claude Code: /loop rerulează un prompt la un interval dat (martie 2026) sau își alege singur ritmul când intervalul lipsește (aprilie 2026), Routines declanșează cloud agents pe bază de template dintr-un program, dintr-un eveniment GitHub sau dintr-un apel de API (aprilie 2026), /goal ține agentul la lucru de la un tur la altul până când o condiție de finalizare e îndeplinită (mai 2026), iar /autofix-pr urmărește CI-ul și comentariile de review și împinge fix-uri până când pull request-ul e verde (aprilie 2026).
Sursa
Claude Code release notes, "What's new": code.claude.com/docs/en/whats-new, weekly digests for April-May 2026.
Unde e folosită
Capitolul 9 (pattern-ul opt).
Atenție
Numele de feature și săptămânile de release reflectă stadiul vendorului la iulie 2026; așteaptă-te la schimbări, conform notei despre afirmațiile datate.
Bucla exterioară
Afirmația
Tehnica Ralph Wiggum - un while-loop de bash care tot trimite un fișier de prompt într-un coding agent, cu context proaspăt la fiecare iterație și starea ținută în repository - pornește de la Geoff Huntley la mijlocul lui 2025 ("In its purest form, Ralph is a Bash loop": while :; do cat PROMPT.md | claude-code ; done), devine virală la sfârșitul lui 2025 și e adoptată în repository-ul oficial Claude Code ca plugin-ul ralph-wiggum în noiembrie 2025 (commit-ul de migrare e datat 16 noiembrie). Huntley estimează costul rulării buclei brute la aproximativ 10 dolari pe oră, spune că multe startup-uri din Y Combinator rulează Ralph și numește modul de eșec central "overbaking".
Sursa
Geoff Huntley, ghuntley.com/ralph (July 2025); HumanLayer, "A Brief History of Ralph," January 6, 2026: humanlayer.dev/blog/brief-history-of-ralph; The Register, January 27, 2026: theregister.com/2026/01/27/ralph_wiggum_claude_loops/.
Unde e folosită
Capitolul 9 (pattern-ul opt), paragrafele despre filiație și overbaking.
Atenție
Cifra de 10 dolari pe oră și afirmația despre adopția în Y Combinator îi aparțin lui Huntley, preluate de The Register - raportări de practician, nu cifre auditate.
Bucla exterioară
Afirmația
Execuția de agenți în fundal și pe bază de program a fost livrată de mai mulți vendori pe parcursul sfârșitului lui 2025: GitHub Copilot coding agent disponibil general pe 25 septembrie 2025 (mediu izolat de GitHub Actions; rezultatul livrat ca draft de pull request; review cerut unui om la finalizare); Cursor Cloud Agents pe 30 octombrie 2025 (mulți agenți detașați, cu laptopul închis); Google Jules Scheduled Tasks pe 10 decembrie 2025 (cadențe recurente pentru muncă de mentenanță).
Sursa
GitHub changelog: github.blog/changelog/2025-09-25-copilot-coding-agent-is-now-generally-available; Cursor blog: cursor.com/blog/cloud-agents; Google blog: blog.google/technology/developers/jules-proactive-updates.
Unde e folosită
Capitolul 9 (pattern-ul opt), paragraful despre convergență.
Atenție
Datele de livrare sunt cele din anunțurile vendorilor; suprafețele au continuat să evolueze de atunci.
Bucla exterioară
Afirmația
Echipa "software factory" de la StrongDM rulează livrare cu agenți complet non-interactivă - oamenii nici nu scriu, nici nu fac review la cod - cu scenarii end-to-end de user story stocate în afara codebase-ului, ca un holdout set pe care agenții nu îl pot vedea sau slăbi, și tratează aproximativ 1.000 de dolari pe zi per inginer cheltuiți pe tokeni drept prag minim de sănătate al fabricii; Simon Willison rezumă economia la circa 20.000 de dolari pe lună per inginer și semnalează asta ca principala limitare a pattern-ului.
Sursa
Simon Willison, "How StrongDM's AI team build serious software without even looking at the code," February 7, 2026: simonwillison.net/2026/Feb/7/software-factory/.
Unde e folosită
Capitolul 9 (pattern-ul opt), polul industrial.
Atenție
Auto-descrierea unei singure companii; sumele în dolari sunt ale echipei și încadrarea lui Willison, nu un audit.
Bucla exterioară
Afirmația
Era buclelor din 2023 - AutoGPT, BabyAGI - rula un model în buclă pe baza propriei lui evaluări a progresului, fără un verificator extern la fiecare iterație, și s-a prăbușit ca abordare de livrare de software în câteva luni. Revirimentul din 2025 diferă structural: fiecare iterație se încheie cu o confruntare cu compilatorul, cu testele și cu diff-ul.
Sursa
The AutoGPT and BabyAGI repositories document the 2023 design: github.com/Significant-Gravitas/AutoGPT, github.com/yoheinakajima/babyagi. The structural contrast is this manual's analysis, drawn from the Ralph-era sources above.
Unde e folosită
Capitolul 9 (pattern-ul opt), paragraful despre filiație.
Atenție
Verdictul de "prăbușire" e o interpretare; ambele proiecte au continuat în alte roluri.

Surse despre harness și migrarea între modele

Harness
Afirmația
Anthropic a scos peste 80% din system prompt-ul propriu al Claude Code pentru generația Claude 5 (Opus 5, Fable 5), fără pierdere măsurabilă pe evaluările lui de coding, înlocuind regulile cu judecată și exemplele lucrate cu interfețe proiectate.
Sursa
Thariq Shihipar, "The new rules of context engineering for Claude 5 generation models," Anthropic blog, July 24, 2026: claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models.
Unde e folosită
Capitolul 6 (plafonul de două sute de linii).
Atenție
Evaluările proprii ale vendorului, pe propriul harness; sfatul e scris pentru generația Claude 5, iar modelele mai vechi s-ar putea să aibă încă nevoie de instrucțiunile șterse.
Harness
Afirmația
Ghidul de prompting al Anthropic pentru Fable 5 spune că subagenții verificatori separați, cu context proaspăt, tind să depășească autocritica; descrie un sistem de memorie cu câte o lecție per fișier, cu rezumat de o linie, actualizată în loc de duplicată, ștearsă când e greșită; documentează opririle timpurii rare pe o declarație de intenție („I'll now run X”) și acțiunile ocazionale necerute, fiecare cu un bloc de prompt; și avertizează că a cere modelului să-și reproducă raționamentul în răspuns poate declanșa categoria de refuz reasoning_extraction.
Sursa
Anthropic, "Prompting Claude Fable 5," Claude Platform docs: platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5.
Unde e folosită
Capitolul 5 (blocul de autonomie din Execute, Review), Capitolul 6 (mecanica jurnalului de greșeli), Anexa B.3 și B.9.
Atenție
Pagină de documentație nedatată, revizuită pe loc; verifică formularea curentă înainte să te bazezi pe o frază anume.
Harness
Afirmația
Ghidul de prompting al Anthropic pentru Fable 5.1 recomandă ca tool-ul care pornește un subagent să se întoarcă imediat, cu rezultatul livrat într-un mesaj ulterior; spune că numele nivelurilor de effort nu corespund aceleiași cantități de gândire de la un model la altul și că Fable 5.1 pe effort low e adesea competitiv cu Opus și Sonnet la cost per task, cu scor mai mare; cere istoric de conversație append-only, pentru că blocurile de gândire sunt valide doar în conversația exactă care le-a produs; notează că, odată cu citirile din cache mai ieftine, compactarea timpurie ca să economisești s-ar putea să nu mai fie schimbul potrivit; și dă o listă de păstrat pentru rezumatele de compactare.
Sursa
Anthropic, "Prompting Claude Fable 5.1," Claude Platform docs: platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5-1.
Unde e folosită
Capitolul 1 (Effort), Capitolul 5 (Execute, igiena contextului), Anexa B.7 și B.9.
Atenție
Pagină de documentație nedatată, pentru un model lansat pe 1 septembrie 2026. Cifra de 0,025x din Capitolul 5 e aritmetica manualului pe prețurile publicate ale citirii din cache și ale input-ului de bază la momentul scrierii; cerința de append-only se aplică, conform ghidului, conturilor create de la 31 august 2026 încoace.
Harness
Afirmația
Pattern-ul „advisor” al Anthropic: Sonnet cu Opus ca advisor a obținut cu 2,7 puncte procentuale mai mult pe SWE-bench Multilingual decât Sonnet singur, la un cost per task agentic cu 11,9% mai mic; Haiku cu un advisor Opus a obținut 41,2% pe BrowseComp față de 19,7% singur, rămânând cu 29% în urma lui Sonnet singur la scor, la un cost per task cu 85% mai mic.
Sursa
Anthropic, "The advisor strategy: Give agents an intelligence boost," April 9, 2026: claude.com/blog/the-advisor-strategy.
Unde e folosită
Anexa A (Pârghiile structurale, rutarea pe tier-uri).
Atenție
Benchmark-uri ale vendorului pe propriile modele; cifrele de cost sunt per task pe acele benchmark-uri, nu un raport general.
Harness
Afirmația
Editarea contextului de la Anthropic (curățarea automată a rezultatelor învechite de tool-uri) a adus o îmbunătățire de 29% pe o evaluare internă de căutare agentică.
Sursa
Anthropic, "Managing context on the Claude Developer Platform," September 29, 2025: claude.com/blog/context-management.
Unde e folosită
Capitolul 5 (igiena contextului), Anexa A (mascare în loc de rezumare).
Atenție
Evaluare internă; postarea descrie curățarea, nu o comparație cu rezumarea - comparația aia e intrarea JetBrains de mai jos.
Harness
Afirmația
Ghidul OpenAI pentru builderi raportează că GPT-5.6 Sol pe effort low a depășit GPT-5.5 pe effort high la Agents' Last Exam, cu harness-ul ținut constant, și că apelarea programatică a tool-urilor a egalat calitatea pe rubrici folosind cu 21% mai puțini tokeni de input pe un benchmark de research financiar.
Sursa
OpenAI, "The builder's guide to GPT-5.6," August 2026: openai.com/index/builders-guide-to-gpt-5-6/; migration guidance in "Prompting guidance for GPT-5.6 Sol," developers.openai.com/api/docs/guides/prompt-guidance-gpt-5p6.
Unde e folosită
Capitolul 1 (Effort, Tool-uri), Anexa B.9.
Atenție
Evaluări ale vendorului; cifra de 21% vine dintr-un singur benchmark (Rogo's Big Finance Benchmark), nu e o medie generală. Ghidul de migrare spune să păstrezi effort-ul curent ca baseline și să compari cu un nivel mai jos - adică sweep-ul din B.9, în cuvintele vendorului.
Harness
Afirmația
Ghidul OpenAI pentru GPT-6 Astra spune că instrucțiunile utilizatorului au prioritate față de îndrumările dintr-un skill; că modelul e mai sensibil la informația din context, așa că o îndrumare neclară sau contradictorie într-un fișier de skill îl poate face să se oprească și să blocheze munca devreme; că e mai înclinat să pună utilizatorului o întrebare când un input ar putea schimba rezultatul; și că tinde spre teste mai late decât cere task-ul, cu contra-îndrumarea de a nu scrie teste pentru modificări reversibile, cu impact mic.
Sursa
OpenAI, "Using GPT-6 Astra," September 2026: developers.openai.com/api/docs/guides/latest-model.
Unde e folosită
Capitolul 5 (blocul de autonomie din Execute), Capitolul 6 (linia de precedență), Anexa B.2 și B.3.
Atenție
Astra e numele de cod al modelului GPT-6 de la OpenAI, lansat pe 3-4 septembrie 2026, nu un produs separat; ghidul e nedatat și revizuit pe loc.
Harness
Afirmația
Practica proprie a OpenAI pentru Codex ține un AGENTS.md scurt, de vreo 100 de linii, care servește în primul rând ca hartă, cu pointeri spre surse de adevăr mai adânci, iar baza de cunoștințe a repository-ului stă într-un director docs/ structurat, tratat ca sistem de referință.
Sursa
Ryan Lopopolo, "Harness engineering: leveraging Codex in an agent-first world," OpenAI, February 11, 2026: openai.com/index/harness-engineering/.
Unde e folosită
Capitolul 6 (unde stă harta), Anexa B.2.
Atenție
Practica unei singure echipe, descrisă de vendor. Harness-ul Codex în sine a fost publicat open source în august 2026 ("Codex as a platform," developers.openai.com/blog/codex-as-a-platform), într-o postare separată.
Harness
Afirmația
Activarea raționamentului păstrat și a compactării a dus GPT-5.6 Sol de la 13,3% la 38,3% pe ARC-AGI-3, reducând în același timp tokenii de output de șase ori, cu harness-ul altfel neschimbat.
Sursa
OpenAI, "How enabling two settings tripled our scores on the ARC-AGI-3 benchmark," July 29, 2026: openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/.
Unde e folosită
Capitolul 1 (Effort, raționamentul păstrat).
Atenție
Postare a vendorului, pe un singur benchmark și un singur model. Manualul o folosește pentru mecanism - raționamentul păstrat între ture se compune - nu pentru scorul concret.
Harness
Afirmația
Ambii agenți majori expun acum un evaluator al condiției de finalizare pe care bucla nu-l controlează: /goal din Claude Code trimite condiția și conversația unui model mic și rapid (Haiku by default) după fiecare tură, care întoarce unul din trei verdicte - neîndeplinit încă, îndeplinit sau imposibil; Codex Goals dă unui thread o condiție de finalizare persistentă și se oprește doar când o evaluare o confirmă sau când se atinge o limită dură.
Sursa
Claude Code docs, "/goal": code.claude.com/docs/en/goal; OpenAI Cookbook, "Using Goals in Codex": developers.openai.com/cookbook/examples/codex/using_goals_in_codex.
Unde e folosită
Capitolul 9 (pattern-ul opt, condiția de oprire).
Atenție
Documentație de mecanism, nu dovezi de rezultat. README-ul plugin-ului ralph-wiggum numește --max-iterations drept principalul mecanism de siguranță și oferă anecdote, nu rezultate controlate; la momentul scrierii nu s-a găsit nicio dovadă controlată pentru niciunul dintre cele trei.
Harness
Afirmația
Fișierele de context la nivel de repository (AGENTS.md și echivalentele lui) n-au îmbunătățit în general rata de succes a agenților de cod, în timp ce au crescut costul de inferență cu peste 20% în medie; privirile de ansamblu asupra repository-ului, deși populare și recomandate de vendorii de modele, n-au fost utile; fișierele scrise de developeri au arătat doar un câștig modest, nesemnificativ, față de cele generate.
Sursa
Thibaud Gloaguen, Niels Mündler, Mark Niklas Müller, Veselin Raychev, Martin Vechev (ETH Zürich), "Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?", February 12, 2026 (v2 June 23, 2026): arxiv.org/abs/2602.11988.
Unde e folosită
Capitolul 6 (unde stă harta), Anexa B.2.
Atenție
Măsurat pe anumiți agenți și anumite benchmark-uri. Lectura manualului - păstrezi pattern-urile interzise, jurnalul, convențiile și comenzile, scoți harta - e o interpretare; lucrarea nu izolează o categorie de conținut cu efect pozitiv semnificativ.
Harness
Afirmația
Pe 260 de configurații multi-agent, coordonarea a ajutat doar pe task-urile descompozabile, a degradat planificarea secvențială cu între 39% și 70% în funcție de arhitectură și a produs randamente negative pe task-urile unde un singur agent depășea deja circa 45% acuratețe.
Sursa
Kim et al., "Capable language models can outgrow the benefits of collaboration," Nature Machine Intelligence 8, 1157-1172, July 24, 2026: doi.org/10.1038/s42256-026-01268-y; preprint "Towards a Science of Scaling Agent Systems," arxiv.org/abs/2512.08296.
Unde e folosită
Capitolul 5 (Execute, gate-ul de împărțire), Anexa B.3.
Atenție
Benchmark-urile nu sunt specifice codului; pragul de 45% e un predictor ajustat pe task-urile testate, nu o lege.
Harness
Afirmația
Pe SpecBench, fiecare agent de frontieră saturează suita de teste vizibilă, în timp ce scorul pe testele ascunse rămâne mult mai mic, cu decalaje de circa 43-48 de puncte procentuale; decalajul la percentila 90 crește cu circa 27 de puncte la fiecare înzecire a numărului de linii de cod; căutarea suplimentară nu elimină fiabil reward hacking-ul.
Sursa
Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu, Zhengyao Jiang (Weco AI), "SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents," May 20, 2026 (v2 September 9, 2026): arxiv.org/abs/2605.21384.
Unde e folosită
Capitolul 5 (Poți avea încredere în testele scrise de agent?), Anexa B.3.
Atenție
Abstractul rotunjește creșterea la 28 de puncte; corpul lucrării raportează 27, cu R² de 0,21, deci trendul e real și zgomotos.
Harness
Afirmația
Pe SWE-bench Pro, 63% dintre rezolvările reușite ale lui Claude Opus 4.8 Max au recuperat fix-ul din upstream în loc să-l derive; sigilarea istoricului de git și tăierea egress-ului de rețea au coborât scorul de la 87,1% la 73,0%.
Sursa
Naman Jain, Cursor, "Reward hacking is swamping model intelligence gains," June 25, 2026: cursor.com/blog/reward-hacking-coding-benchmarks.
Unde e folosită
Capitolul 5 (Poți avea încredere în testele scrise de agent?).
Atenție
Harness-ul unui singur vendor și un singur model; comportamentul e o proprietate a gate-ului, nu a modelului numit.
Harness
Afirmația
Într-un setup de raționament multi-agent, criticile verificate ca utile ale reviewerului mai precis au schimbat următorul candidat doar în 33,6% din cazuri, în timp ce un setup broadcast (între egali) a ajuns la 93,5% și la rata finală de succes mai mare.
Sursa
Chih-Hsuan Yang et al., "Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning," July 16, 2026: arxiv.org/abs/2607.15388.
Unde e folosită
Capitolul 5 (Review), Anexa B.3.
Atenție
Raționament matematic, nu code review; manualul împrumută măsurătoarea - preluarea contează mai mult decât precizia -, nu domeniul.
Harness
Afirmația
O buclă de verificare-și-reparare ghidată de rubrici (DeepVerifier) a atins vârful în jurul rundei a patra și scăzuse până la a zecea, pentru că tranziția incorect-la-corect se stinge repede, în timp ce tranziția corect-la-incorect persistă.
Sursa
Yuxuan Wan et al., "Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification," January 22, 2026 (v2 April 29, 2026): arxiv.org/abs/2601.15808.
Unde e folosită
Capitolul 5 (Review, plafonarea rundelor), Anexa B.3.
Atenție
Agenți de deep research pe GAIA, nu coding; scăderea față de vârf e de câteva puncte, deci lecția e forma curbei, nu mărimea căderii.
Harness
Afirmația
Judecătorii LLM se ancorează de un scor anterior care li se arată, și nici raționamentul chain-of-thought, nici un avertisment explicit de a ignora metadatele nu elimină efectul total.
Sursa
Ante Kapetanovic et al., "Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence," August 26, 2026: arxiv.org/abs/2608.25869.
Unde e folosită
Capitolul 5 (Review, al doilea reviewer rămâne orb la primul), Anexa B.3.
Atenție
Context de evaluare, nu de code review; manualul aplică rezultatul la situația în care reviewerul doi vede verdictele reviewerului unu.
Harness
Afirmația
Rata cu care un model satisface deodată toate regulile dintr-un prompt se prăbușește la zero pe la 80 de reguli simultane, pentru fiecare model, format și plasare testate, inclusiv Claude Sonnet 5 și Claude Haiku.
Sursa
Netanel Eliav, "Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models," July 21, 2026: arxiv.org/abs/2607.19257.
Unde e folosită
Capitolul 6 (plafonul de două sute de linii).
Atenție
Rata de răspuns perfect e o metrică strictă; alte lucrări din 2026, pe alte modele de frontieră, raportează praguri mai blânde. Manualul folosește prăbușirea ca să dimensioneze fișierul, nu ca să prezică o cifră anume de conformare.
Harness
Afirmația
RULER măsoară o lungime efectivă a contextului - cel mai lung input la care un model își păstrează un scor-prag pe task-uri de retrieval și raționament pe toată fereastra -, iar la majoritatea modelelor testate lungimea asta cade mult sub dimensiunea de context declarată.
Sursa
Cheng-Ping Hsieh et al. (NVIDIA), "RULER: What's the Real Context Size of Your Long-Context Language Models?", 2024: arxiv.org/abs/2404.06654.
Unde e folosită
Capitolul 1 (context window).
Atenție
Lectura „pe la jumătate” din Capitolul 1 e o regulă empirică din sintezele practicienilor din 2026 pe rezultate de tip RULER, nu o singură măsurătoare; lungimile efective per model variază mult și se îmbunătățesc cu fiecare generație.
Harness
Afirmația
Pentru sesiuni lungi de coding agentic, mascarea observațiilor vechi de tool-uri a bătut rezumarea cu LLM în patru din cinci setări, a tăiat costul cu peste 50% și a egalat sau a depășit ușor rezumarea la rata de rezolvare.
Sursa
Katie Fraser and Tobias Lindenbauer, JetBrains Research, "Cutting Through the Noise: Smarter Context Management for LLM-Powered Agents," December 2025: blog.jetbrains.com/research/2025/12/efficient-context-management/ (paper: "The Complexity Trap," NeurIPS 2025 DL4Code workshop).
Unde e folosită
Capitolul 5 (igiena contextului), Anexa A, Anexa B.7.
Atenție
Cifra de 52% citată uneori e o singură configurație (Qwen3-Coder 480B); rezultatul general e „peste 50%”.
Harness
Afirmația
Pe 15 modele, performanța în conversații multi-turn fragmentate a scăzut cu 39% în medie față de o singură tură complet specificată, iar consolidarea fragmentelor într-o singură tură a recuperat cam 95% din rezultatul single-turn.
Sursa
Philippe Laban, Hiroaki Hayashi, Yingbo Zhou, Jennifer Neville, "LLMs Get Lost in Multi-Turn Conversation," May 2025: arxiv.org/abs/2505.06120.
Unde e folosită
Capitolul 5 (igiena contextului, commit și pornește curat).
Atenție
Conversații simulate pe task-uri de generare, nu sesiuni de coding; manualul o folosește pentru mecanismul din spatele consolidării înainte de a continua.
Harness
Afirmația
Opus 4.8 și Sonnet 5 inventează chei pe care o schemă imbricată de tool custom nu le-a declarat niciodată, în timp ce modelele mai vechi nu, iar pornirea invocării stricte a tool-urilor a eliminat comportamentul.
Sursa
Armin Ronacher, "Better Models: Worse Tools," July 4, 2026: lucumr.pocoo.org/2026/7/4/better-models-worse-tools/.
Unde e folosită
Capitolul 1 (Tool-uri), Anexa B.9.
Atenție
Rulările unui singur practician pe un singur harness; recomandarea - decodare strictă pe schemele custom - nu costă nimic de adoptat oricum.
Harness
Afirmația
Într-un harness multi-agent, faci fork pe un worker ca să primească istoricul și cache-ul de prompt ale supervizorului și să continue investigația, și izolezi un verificator ca să evalueze munca în sine în loc să fie ancorat de diagnosticul supervizorului; în sistemele multi-agent care funcționează, scrierile rămân pe un singur fir, iar agenții suplimentari contribuie cu inteligență, nu cu acțiuni.
Sursa
Thushanth Bengre and Chester Curme, LangChain, "Organizing Context in a Multi-Agent Harness," September 8, 2026: langchain.com/blog/organizing-context-in-a-multi-agent-harness; Walden Yan, Cognition, "Multi-Agents: What's Actually Working," April 22, 2026: cognition.com/blog/multi-agents-working.
Unde e folosită
Capitolul 5 (Execute, gate-ul de împărțire), Anexa B.3.
Atenție
Ambele sunt postări de inginerie ale unor vendori; „un singur scriitor” e comprimarea manualului pentru „scrierile rămân pe un singur fir” al lui Cognition.
Harness
Afirmația
Runtime-ul de afirmații din OpenWiki, care atașează pointeri la dovezi afirmațiilor stocate și le reverifică, a tăiat afirmațiile învechite din baza lui de cunoștințe de la 3,5% la 0,5% pe 2.000 de afirmații evaluate.
Sursa
Colin Francis, "Building Self-Correcting Memory in OpenWiki," LangChain blog, August 25, 2026: langchain.com/blog/self-correcting-memory-openwiki.
Unde e folosită
Capitolul 6 (mecanica jurnalului de greșeli).
Atenție
Un sistem de bază de cunoștințe, nu un jurnal de greșeli; manualul împrumută mecanismul - o afirmație care își citează dovada poate fi retrasă când dovada se învechește.
Harness
Afirmația
Navigarea agentică pe Claude Sonnet 4.5 a ajuns la 49,6% recall@1 pe BRIGHT, cu 21,8 puncte peste cel mai bun model de embeddings; spațiile de lucru mărginite (RISE) țin retrieval-ul agentic funcțional la un milion de documente, acolo unde inspecția directă a contextului se degradează; iar căutarea în cod pentru agenți se reduce la trei modalități - lexicală (ripgrep), structurală (ast-grep) și de graf (referințe LSP).
Sursa
Susheel Suresh et al., "AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases," May 7, 2026: arxiv.org/abs/2605.05538; Shengyao Zhuang et al., "Towards Retrieving Interaction Spaces for Agentic Search" (RISE), June 5, 2026: arxiv.org/abs/2606.06880; Andrey Kumanyaev, "Code search for AI agents: the grep replacement is three tools, not one," June 6, 2026: zzet.org/gortex/grep-replacement-for-ai-agents/.
Unde e folosită
Capitolul 7 (de ce citește agentul codul, nu un index).
Atenție
Cifra de recall e pe un benchmark general de retrieval, nu pe un codebase; încadrarea cu trei tool-uri e a unui practician, iar manualul nu dă niciun prag numeric pentru momentul în care un index de embeddings începe să rentabilizeze.
Harness
Afirmația
Prompt caching-ul cu un layout de prompt cache-first a redus costul de API cu 41% până la 80% la mai mulți provideri, pe peste 500 de sesiuni de agent; o sesiune default de Claude Code s-a dovedit a consuma cam 24.000 de tokeni de definiții de tool-uri, scheme MCP și reminder-e înainte de orice interacțiune a utilizatorului; cu un pool mare de tool-uri încărcat integral, acuratețea de bază a selecției de tool-uri a fost 13,62%, iar recuperarea doar a tool-urilor relevante per query a urcat-o la 43,13%; socoteala unui practician a pus trei servere MCP la circa 143.000 de tokeni dintr-o fereastră de 200.000.
Sursa
Elias Lumer et al., "Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks," January 31, 2026: arxiv.org/abs/2601.06007; GitHub issue anthropics/claude-code#42452, April 2, 2026; Tiantian Gan and Qiyao Sun, "RAG-MCP: Mitigating Prompt Bloat in LLM Tool Selection via Retrieval-Augmented Generation," May 6, 2025: arxiv.org/abs/2505.03275; MetaBlogue, "MCP servers and the context window," September 5, 2026: metablogue.com/mcp-servers-context-window/.
Unde e folosită
Capitolul 1 (Tool-uri), Anexa A (Pârghiile structurale).
Atenție
Cifrele de 24k și 143k sunt socoteli de practicieni, care variază de la o instalare la alta, și nu vin dintr-un studiu controlat; cifrele RAG-MCP compară o metodă de retrieval cu un baseline fără retrieval, la scară, și datează din 2025.
Harness
Afirmația
Pentru între 37% și 63% dintre lucrările de inginerie software analizate, un model mai nou cu un singur prompt depășește nativ tooling-ul puternic ingineresc propus cu circa un an înainte.
Sursa
Nahian Salsabil et al., "What Survives the Next Model? Benchmarking LLM-Based Techniques Against Single-Prompts," August 31, 2026: arxiv.org/abs/2609.00468.
Unde e folosită
Capitolul 8 (semnalul soft de lângă viteza schimbării), Anexa B.9.
Atenție
Preprint pe arXiv, încă fără peer review; manualul îl folosește pentru direcție - fiecare generație pensionează o parte din harness -, nu pentru fracția exactă.

Note despre actualitate

Majoritatea surselor din anexa asta sunt datate. Documentația tool-urilor se actualizează frecvent; înregistrările de vulnerabilități se amendează pe măsură ce apar patch-uri și variante noi. Framework-urile din corpul manualului sunt gândite să supraviețuiască oricărui URL anume. Dacă un URL moare, afirmația din spatele lui ar trebui să rămână căutabilă după numele incidentului, al studiului sau al produsului.