Lo sludge web consuma il tuo budget token
Navigazione, banner cookie, piè di pagina, annunci: la maggior parte di una pagina raccolta è boilerplate che paghi per incorporare e pagare di nuovo per promptare.
Caso d'uso · Scraper e crawler
LeanCTX trasforma le pagine raccolte in contesto pronto per il modello: ctx_url_read ingerisce HTML, PDF, RSS e trascrizioni di YouTube, rimuove il boilerplate, deduplica tra le pagine ed estrae fatti e citazioni. Il tuo crawler rimane semplice. Lo strato di contesto riduce l'output del 60-90% prima che qualsiasi modello lo veda.
Same engine. Different workflow. Always the right context.
Navigazione, banner cookie, piè di pagina, annunci: la maggior parte di una pagina raccolta è boilerplate che paghi per incorporare e pagare di nuovo per promptare.
Lo stesso articolo appare su cinque URL. Senza deduplicazione consapevole del contenuto lo memorizzi e lo elabori cinque volte.
Una cartella di HTML raccolti non è una knowledge base. Il tuo agente ha bisogno di retrieval classificato, non di 10.000 file.
Tutto qui sotto è disponibile nel binario open-source di oggi. Niente elementi della roadmap, niente liste d'attesa.
ctx_url_read gestisce HTML, feed RSS, PDF e trascrizioni di YouTube
le pagine si collassano in fatti attribuibili e citazioni verbali
dedup basato su hash di contenuto tra pagine, sessioni e crawl
tutto ciò che viene ingerito diventa localmente ricercabile e classificabile
gli originali rimangono recuperabili; la compressione non è mai un vicolo cieco
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Ogni formato di acquisizione e come viene normalizzato.
Scopri di piùDa URL a risposta citata, end to end.
Scopri di piùCome i contenuti ingeriti persistono e vengono classificati.
Scopri di piùfatti, citazioni, entropia e amici.
Scopri di piùNo. Si posiziona dopo il tuo scraper. Mantieni Playwright, Scrapy o curl; invia l'output tramite LeanCTX e i tuoi modelli ricevono un contesto de-duplicato, compresso e ricercabile invece di HTML grezzo.
Pagine HTML, PDF, CSV, feed RSS/Atom, testo semplice, email e trascrizioni YouTube. Ogni formato ha la propria strategia di normalizzazione prima della compressione.
Sempre. Ogni originale è archiviato localmente e recuperabile tramite ctx_retrieve. La compressione in LeanCTX è reversibile per design.
Gratuito per uso locale, per sempre. CI lo impone. Un binario, dieci minuti per il primo guadagno misurato.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.