Lixo web consome seu orçamento de tokens
Navegação, banners de cookies, rodapés, anúncios: a maior parte de uma página raspada é texto padrão que você paga para incorporar e pagar novamente para solicitar.
Caso de uso · Scrapadores e crawlers
LeanCTX transforma páginas raspadas em contexto pronto para modelos: ctx_url_read ingere HTML, PDF, RSS e transcrições do YouTube, remove texto padrão (boilerplate), desduplica entre páginas e extrai fatos e citações. Seu crawler permanece simples. A camada de contexto reduz o tamanho da saída em 60–90% antes que qualquer modelo a veja.
Same engine. Different workflow. Always the right context.
Navegação, banners de cookies, rodapés, anúncios: a maior parte de uma página raspada é texto padrão que você paga para incorporar e pagar novamente para solicitar.
O mesmo artigo aparece em cinco URLs. Sem desduplicação consciente do conteúdo, você armazena e processa isso cinco vezes.
Uma pasta de HTML raspado não é uma base de conhecimento. Seu agente precisa de recuperação ranqueada, não de 10.000 arquivos.
Tudo abaixo é entregue no binário open-source hoje. Sem itens de roadmap, sem listas de espera.
ctx_url_read lida com HTML, feeds RSS, PDFs e transcrições do YouTube
páginas colapsam em fatos atribuíveis e citações literais
dedup de hash de conteúdo entre páginas, sessões e raspagens
tudo o que é ingerido se torna pesquisável e ranqueável localmente
originais permanecem recuperáveis; a compressão nunca é um beco sem saída
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Cada formato de entrada e como ele é normalizado.
Saiba maisDe URL a resposta citada, ponta a ponta.
Saiba maisComo o conteúdo ingerido persiste e classifica.
Saiba maisfatos, citações, entropia e amigos.
Saiba maisNão. Ele fica depois do seu scraper. Mantenha Playwright, Scrapy ou curl; passe a saída pelo LeanCTX e seus modelos recebem contexto desduplicado, comprimido e pesquisável em vez de HTML bruto.
Páginas HTML, PDFs, CSV, feeds RSS/Atom, texto simples, email e transcrições do YouTube. Cada formato tem sua própria estratégia de normalização antes da compressão.
Sempre. Todo original é arquivado localmente e recuperável via ctx_retrieve. A compressão no LeanCTX é reversível por design.
Gratuito para uso local, para sempre. O CI garante isso. Um binário, dez minutos até o primeiro ganho mensurável.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.