Cas d'usage · Scrapeurs et robots de crawling

Scraper brut. Flux lean.

LeanCTX transforme les pages récupérées en contexte prêt pour le modèle : ctx_url_read ingère HTML, PDF, RSS et transcriptions YouTube, supprime le contenu répétitif (boilerplate), déduplique entre les pages et extrait des faits et des citations. Votre crawler reste simple. La couche de contexte réduit sa sortie de 60 à 90 % avant que tout modèle ne la voie.

Same engine. Different workflow. Always the right context.

Ce que cela vous coûte aujourd'hui.

Les données web inutiles consomment votre budget de jetons

Navigation, bannières de cookies, pieds de page, publicités : la majeure partie d'une page récupérée est du contenu répétitif que vous payez pour intégrer et encore pour le prompt.

Les doublons se multiplient en silence

Le même article apparaît sur cinq URL. Sans déduplication sensible au contenu, vous le stockez et le traitez cinq fois.

Les dumps bruts sont non consultables

Un dossier de HTML récupérés n'est pas une base de connaissances. Votre agent a besoin d'une récupération classée, pas de 10 000 fichiers.

Les capacités qui font le travail.

Tout ce qui suit est disponible dans le binaire open-source dès aujourd'hui. Pas d'éléments de feuille de route, pas de listes d'attente.

Vos outilsLeanCTXModèle

Intake universel

ctx_url_read gère les HTML, PDF, flux RSS et transcriptions YouTube

Modes Faits & citations

les pages se transforment en faits attribuables et citations verbatim

Déduplication

déduplication par hachage de contenu entre les pages, sessions et crawls

BM25 + recherche graphique

tout ce qui est ingéré devient localement consultable et classifiable

Archive locale

les originaux restent récupérables ; la compression n'est jamais une impasse

De zéro à le premier gain.

terminal
# ingérer une page en faits attribuables$ ctx_url_read("https://example.com/article", mode="facts")
# ingérer un flux ; les éléments arrivent datés et dédupliqués$ ctx_url_read("https://news.site/feed.xml")
# rechercher tout ce que vous avez ingéré$ lean-ctx grep "quarterly revenue"
# récupérer l'original complet si nécessaire$ ctx_retrieve(id)

Questions des équipes avant l'adoption.

Reprenez le contrôle de votre contexte.

Gratuit pour un usage local, pour toujours. CI l'impose. Un binaire, dix minutes jusqu'au premier gain mesurable.

Support this project