Standard otwarty · v1.0-draft

Jak wygląda zarządzany potok kontekstu w praktyce?

CIS Benchmarks definiują, czym jest zabezpieczony serwer. Context Governance Benchmark definiuje, czym jest zarządzany potok kontekstu: 32 mierzalne kontrole narzędziowo-neutralne w 6 domenach, oceniane na cztery poziomy dojrzałości. Cytowalny przez zespoły bezpieczeństwa, zakupy i prasę — bezpłatny na licencji CC-BY 4.0.

Status: v1.0-draft, przed recenzją. Katalog jest opublikowany i otwarty na uwagi; v1.0-final wymaga ≥ 3 zewnętrznych recenzentów. Do tego czasu nie cytuj go jako standardu wydanego — cytuj wersję roboczą.

32 kontrole, 6 domen.

Każdy kontrolny stwierdza wymaganie, dlaczego jest ważne, konkretną metodę pomiaru i poziom. Trzy poziomy wzajemnie się uzupełniają: Podstawowy (12-kontrolny minimum), Ulepszony (15 kontroli dla danych klientów lub regulowanych) oraz Audytowany (5 kontroli z weryfikacją przez stronę trzecią).

CGB-1 · 6 kontrole

Wrażliwość i redakcja

Poświadczenia, dane osobowe i regulowane identyfikatory nigdy nie mogą przekroczyć granicy zaufania. Wykrywanie, redakcja i gwarancje związane z nimi.

CGB-2 · 5 kontrole

Pochodzenie i integralność

Dla każdej interakcji z modelem: co trafiło do kontekstu, skąd pochodzi, czy zostało zmienione? Atrybucja źródła, ujawnienie transformacji, dowód manipulacji.

CGB-3 · 5 kontrole

Kontrola budżetu i zasobów

Jeden prompt rozchodzi się na wiele wywołań narzędzi i podagentów. Limity, atrybucja i zatrzymywanie niekontrolowanego zużycia przed wystawieniem faktury.

CGB-4 · 6 kontrole

Audyt i dowody

Twierdzenia dotyczące zarządzania są tak silne, jak zapisy za nimi. Co jest logowane, jak jest chronione i czy strona trzecia może to zweryfikować.

CGB-5 · 5 kontrole

Zakres dostępu

Do czego agent może się dostać, na czyjej podstawie? System plików, wykonanie poleceń, sieć i granice narzędzi — asystent, a nie niezaudowany shell root.

CGB-6 · 5 kontrole

Cykl życia i retencja

Pamięci podręczne, magazyny sesji, pamięć długoterminowa, wspólna wiedza: jak akumulowane stany są ograniczone, wygaszane, usuwane i utrzymywane w uczciwości w czasie.

Cztery stopnie, żadnego C0 do ukrycia.

Kontrole osiągnięte (1.0), Częściowo (0.5, opis luki) lub Nieosiągnięte (0). Wynik poziomu to punkty z dostępnych kontroli. Ocena to najwyższy próg, który przechodzi potok — poniżej C1 jest po prostu nieoceniony.

C1

Foundational

Basic ≥ 75%

C2

Managed

Podstawowy ≥ 90% i Ulepszony ≥ 50%

C3

Hardened

Podstawowy = 100%, Ulepszony ≥ 80%, Audytowany ≥ 40%, każda osiągnięta kontrola wiąże dowód

C4

Audited

Podstawowy = 100%, Ulepszony = 100%, Audytowany ≥ 80%, niezależnie zweryfikowane

Od C3 wzwyż, każde twierdzenie Osiągnięte wiąże dowód, który może otworzyć recenzent. Od C4 samo oszacowanie jest niezależnie weryfikowane — samooceny zatrzymują się na poziomie C3 z założenia.

The benchmark for responsible AI context management.

Ocena własna C2 — i pokazujemy luki.

Specyfikacja jest niezależna od narzędzi; ta część nie. LeanCTX samoocenia się względem wersji roboczej v1.0 na poziomie C2 — Zarządzane: Podstawowe 96% · Ulepszone 80% · Audytowane 50%. Tam, gdzie roszczenie nie mogło zostać zweryfikowane w sposób twardy, kontrola jest oceniana niżej, a nie wyżej.

Opublikowane luki obejmują CGB-1.4 (pokrycie redakcji typu fail-closed jest konwencjonalne, a nie strukturalnie udowodnione przez bramę CI) oraz kilka kontroli na poziomie Audytowanym, które oczekują na weryfikację zewnętrzną. Pełne wyniki dla każdej kontroli — łącznie z każdym Częściowo i Nieosiągniętym — znajdują się w public self-assessment.

Oceń własną konfigurację: lean-ctx policy coverage --benchmark cgb statycznie sprawdza Twój rozstrzygnięty pakiet polityk względem testowalnych kontroli — sztucznych fixture'ów, a nie zaufania do nazw wzorców.

Wersjonowane jak specyfikacja.

Identyfikatory kontroli są stałe i nigdy nie są ponownie używane. Istotne zmiany przechodzą przez proces zbliżony do RFC z 14-dniowym oknem na komentarze i odnotowanym sprzeciwem. Katalog jest przeglądany corocznie; projekty zawsze są oznaczone. Licencja: CC-BY 4.0.

Review board — open call. v1.0-final zostanie wydany, gdy co najmniej 3 zewnętrznych recenzentów (specjalistów ds. bezpieczeństwa, zgodności lub inżynierii platformy, bez pojedynczego komercyjnego interesu dostawcy) przeanalizuje każdą domenę. Recenzenci są wymienieni w specyfikacji wydanej. Wolontariat poprzez zgłoszenie →

Benchmark, odpowiedź na pytania. answered.

The standard, its scoring, and how to assess a context pipeline.

Govern the layerthat feeds your models.

Przeczytaj specyfikację, oceń swój potok danych, zgłoś problemy — lub zobacz, jak LeanCTX implementuje te kontrole lokalnie, za darmo na zawsze. CGB definiuje kontrole; Open Context Protocol definiuje format przesyłania danych; mapowania zgodności łączą oba z EU AI Act, ISO 42001 i SOC 2.

Support this project