Webのノイズがトークン予算を食いつぶす
ナビゲーション、クッキーバナー、フッター、広告:スクレイピングされたページのほとんどは定型文であり、埋め込むためにお金を払い、プロンプトするためにもう一度お金がかかります。
ユースケース · スクレイパーとクローラー
LeanCTXは、スクレイピングしたページをモデルが利用可能なコンテキストに変換します:ctx_url_readはHTML、PDF、RSS、YouTubeのトランスクリプトを取り込み、定型文を除去し、ページ間で重複排除を行い、事実と引用を抽出します。クローラーはシンプルさを保てます。このコンテキストレイヤーにより、モデルがそれを見る前に出力が60〜90%削減されます。
Same engine. Different workflow. Always the right context.
ナビゲーション、クッキーバナー、フッター、広告:スクレイピングされたページのほとんどは定型文であり、埋め込むためにお金を払い、プロンプトするためにもう一度お金がかかります。
同じ記事が5つのURLに存在する場合。コンテンツを考慮した重複排除がないと、それを5回分保存し、処理することになります。
スクレイピングされたHTMLのフォルダはナレッジベースではありません。エージェントに必要なのは10,000個のファイルではなく、ランキング付きのリトリーバルです。
以下すべてが、オープンソースのバイナリとして本日出荷されます。ロードマップ項目も、ウェイティングリストもありません。
ctx_url_readはHTML、PDFフィード、RSSフィード、YouTubeトランスクリプトを処理します
ページが帰属可能なファクトと逐語的な引用に集約されます
ページ、セッション、クローリングを横断したコンテンツハッシュによる重複排除
取り込まれたすべてのものがローカルで検索可能かつランキング可能になります
オリジナルは取得可能に保たれます。圧縮が行き止まりになることはありません。
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)いいえ。これはスクレイパーの後に配置されます。Playwright、Scrapy、またはcurlを維持してください。出力をLeanCTXにパイプし、モデルは生のHTMLではなく、重複排除され、圧縮され、検索可能なコンテキストを受け取ります。
HTMLページ、PDF、CSV、RSS/Atomフィード、プレーンテキスト、メール、およびYouTubeトランスクリプト。各形式は圧縮前に独自の正規化戦略を持ちます。
常に可能です。すべてのオリジナルはローカルにアーカイブされ、ctx_retrieve経由で取得できます。LeanCTXの圧縮は設計上可逆的です。
ローカル利用は無料、永久に。CIが強制する。単一バイナリで、最初の測定可能な成果まで10分。
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.