Los residuos web consumen tu presupuesto de tokens
Navegación, banners de cookies, pies de página, anuncios: la mayor parte de una página raspada es texto repetitivo que pagas para incrustar y pagar de nuevo para solicitar.
Caso de uso · Scrapadores y rastreadores
LeanCTX convierte páginas raspadas en contexto listo para el modelo: ctx_url_read ingiere HTML, PDF, RSS y transcripciones de YouTube, elimina texto repetitivo (boilerplate), desduplica entre páginas y extrae hechos y citas. Tu rastreador permanece simple. La capa de contexto reduce su salida entre un 60% y un 90% antes de que cualquier modelo la vea.
Same engine. Different workflow. Always the right context.
Navegación, banners de cookies, pies de página, anuncios: la mayor parte de una página raspada es texto repetitivo que pagas para incrustar y pagar de nuevo para solicitar.
El mismo artículo aparece en cinco URLs. Sin desduplicación consciente del contenido, lo almacenas y procesas cinco veces.
Una carpeta de HTML raspado no es una base de conocimiento. Tu agente necesita recuperación clasificada, no 10.000 archivos.
Todo lo siguiente se implementa en el binario de código abierto hoy. Sin elementos de hoja de ruta, sin listas de espera.
ctx_url_read maneja HTML, feeds RSS, PDFs y transcripciones de YouTube
las páginas se colapsan en hechos atribuibles y citas textuales
desduplicación por hash de contenido entre páginas, sesiones y rastreos
todo lo ingerido se vuelve localmente buscable y clasificable
los originales permanecen recuperables; la compresión nunca es un callejón sin salida
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Cada formato de ingesta y cómo se normaliza.
Saber másDe URL a respuesta citada, de principio a fin.
Saber másCómo persiste y se clasifica el contenido ingerido.
Saber máshechos, citas, entropía y amigos.
Saber másNo. Se sitúa después de tu scraper. Mantén Playwright, Scrapy o curl; canaliza la salida a través de LeanCTX y tus modelos recibirán contexto desduplicado, comprimido y searchable en lugar de HTML sin procesar.
Páginas HTML, PDFs, CSV, feeds RSS/Atom, texto plano, correo electrónico y transcripciones de YouTube. Cada formato tiene su propia estrategia de normalización antes de la compresión.
Siempre. Cada original se archiva localmente y es recuperable a través de ctx_retrieve. La compresión en LeanCTX es reversible por diseño.
Gratis para uso local, siempre. CI lo exige. Un binario, diez minutos hasta la primera ganancia medida.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.