Web-Schlamm frisst dein Token-Budget
Navigation, Cookie-Banner, Footer, Werbung: der Großteil einer gescrapten Seite ist Boilerplate, den du fürs Einbetten zahlst und fürs Prompten nochmal.
Anwendungsfall · Scraper & Crawler
LeanCTX verwandelt gescrapte Seiten in modellfertigen Kontext: ctx_url_read nimmt HTML, PDF, RSS und YouTube-Transkripte auf, entfernt Boilerplate, dedupliziert über Seiten hinweg und extrahiert Fakten und Zitate. Dein Crawler bleibt simpel. Die Kontextschicht macht seine Ausgabe 60–90% kleiner, bevor irgendein Modell sie sieht.
Same engine. Different workflow. Always the right context.
Navigation, Cookie-Banner, Footer, Werbung: der Großteil einer gescrapten Seite ist Boilerplate, den du fürs Einbetten zahlst und fürs Prompten nochmal.
Derselbe Artikel erscheint unter fünf URLs. Ohne content-bewusste Deduplizierung speicherst und verarbeitest du ihn fünfmal.
Ein Ordner voll gescraptem HTML ist keine Wissensbasis. Dein Agent braucht gerankte Retrieval, nicht 10.000 Dateien.
Alles hier unten steckt heute in der Open-Source-Binary. Keine Roadmap-Punkte, keine Wartelisten.
ctx_url_read verarbeitet HTML, PDF, RSS-Feeds und YouTube-Transkripte
Seiten kollabieren zu zuordenbaren Fakten und wortgetreuen Zitaten
Content-Hash-Dedup über Seiten, Sessions und Crawls hinweg
alles Aufgenommene wird lokal durchsuchbar und rankbar
Originale bleiben abrufbar; Kompression ist nie eine Sackgasse
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Jedes Aufnahmeformat und wie es normalisiert wird.
Mehr erfahrenVon der URL zur zitierten Antwort, end-to-end.
Mehr erfahrenWie aufgenommene Inhalte bestehen bleiben und ranken.
Mehr erfahrenfacts, quotes, entropy und Freunde.
Mehr erfahrenNein. Es sitzt hinter deinem Scraper. Behalte Playwright, Scrapy oder curl; leite die Ausgabe durch LeanCTX und deine Modelle erhalten deduplizierten, komprimierten, durchsuchbaren Kontext statt rohem HTML.
HTML-Seiten, PDFs, CSV, RSS/Atom-Feeds, Klartext, E-Mail und YouTube-Transkripte. Jedes Format hat seine eigene Normalisierungsstrategie vor der Kompression.
Immer. Jedes Original wird lokal archiviert und ist über ctx_retrieve abrufbar. Kompression in LeanCTX ist per Design umkehrbar.
Kostenlos für lokale Nutzung, für immer. Per CI erzwungen. Eine Binary, zehn Minuten bis zum ersten gemessenen Gewinn.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.