Les données web inutiles consomment votre budget de jetons
Navigation, bannières de cookies, pieds de page, publicités : la majeure partie d'une page récupérée est du contenu répétitif que vous payez pour intégrer et encore pour le prompt.
Cas d'usage · Scrapeurs et robots de crawling
LeanCTX transforme les pages récupérées en contexte prêt pour le modèle : ctx_url_read ingère HTML, PDF, RSS et transcriptions YouTube, supprime le contenu répétitif (boilerplate), déduplique entre les pages et extrait des faits et des citations. Votre crawler reste simple. La couche de contexte réduit sa sortie de 60 à 90 % avant que tout modèle ne la voie.
Same engine. Different workflow. Always the right context.
Navigation, bannières de cookies, pieds de page, publicités : la majeure partie d'une page récupérée est du contenu répétitif que vous payez pour intégrer et encore pour le prompt.
Le même article apparaît sur cinq URL. Sans déduplication sensible au contenu, vous le stockez et le traitez cinq fois.
Un dossier de HTML récupérés n'est pas une base de connaissances. Votre agent a besoin d'une récupération classée, pas de 10 000 fichiers.
Tout ce qui suit est disponible dans le binaire open-source dès aujourd'hui. Pas d'éléments de feuille de route, pas de listes d'attente.
ctx_url_read gère les HTML, PDF, flux RSS et transcriptions YouTube
les pages se transforment en faits attribuables et citations verbatim
déduplication par hachage de contenu entre les pages, sessions et crawls
tout ce qui est ingéré devient localement consultable et classifiable
les originaux restent récupérables ; la compression n'est jamais une impasse
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Chaque format d'entrée et sa normalisation.
En savoir plusDe l'URL à la réponse citée, de bout en bout.
En savoir plusComment le contenu ingéré persiste et est classé.
En savoir plusfaits, citations, entropie et amis.
En savoir plusNon. Il se place après votre scraper. Gardez Playwright, Scrapy ou curl ; transmettez la sortie via LeanCTX et vos modèles recevront un contexte dédupliqué, compressé et consultable au lieu de HTML brut.
Pages HTML, PDF, CSV, flux RSS/Atom, texte brut, e-mail et transcriptions YouTube. Chaque format a sa propre stratégie de normalisation avant la compression.
Toujours. Chaque original est archivé localement et récupérable via ctx_retrieve. La compression dans LeanCTX est réversible par conception.
Gratuit pour un usage local, pour toujours. CI l'impose. Un binaire, dix minutes jusqu'au premier gain mesurable.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.