ユースケース · スクレイパーとクローラー

生データをスクレイピング。 LeanCTXにフィードする。

LeanCTXは、スクレイピングしたページをモデルが利用可能なコンテキストに変換します:ctx_url_readはHTML、PDF、RSS、YouTubeのトランスクリプトを取り込み、定型文を除去し、ページ間で重複排除を行い、事実と引用を抽出します。クローラーはシンプルさを保てます。このコンテキストレイヤーにより、モデルがそれを見る前に出力が60〜90%削減されます。

Same engine. Different workflow. Always the right context.

それがあなたに費やさせるコスト 今日。

Webのノイズがトークン予算を食いつぶす

ナビゲーション、クッキーバナー、フッター、広告:スクレイピングされたページのほとんどは定型文であり、埋め込むためにお金を払い、プロンプトするためにもう一度お金がかかります。

重複が静かに増殖する

同じ記事が5つのURLに存在する場合。コンテンツを考慮した重複排除がないと、それを5回分保存し、処理することになります。

生データは検索不可能

スクレイピングされたHTMLのフォルダはナレッジベースではありません。エージェントに必要なのは10,000個のファイルではなく、ランキング付きのリトリーバルです。

その能力が 作業をこなす。

以下すべてが、オープンソースのバイナリとして本日出荷されます。ロードマップ項目も、ウェイティングリストもありません。

あなたのツールLeanCTXモデル

ユニバーサルな取り込み

ctx_url_readはHTML、PDFフィード、RSSフィード、YouTubeトランスクリプトを処理します

ファクトと引用モード

ページが帰属可能なファクトと逐語的な引用に集約されます

重複排除

ページ、セッション、クローリングを横断したコンテンツハッシュによる重複排除

BM25 + グラフ検索

取り込まれたすべてのものがローカルで検索可能かつランキング可能になります

ローカルアーカイブ

オリジナルは取得可能に保たれます。圧縮が行き止まりになることはありません。

ゼロから始める 最初の成果を。

terminal
# ページをアトリビューション可能なファクトとして取り込む$ ctx_url_read("https://example.com/article", mode="facts")
# フィードを取り込みます。アイテムは日付付きで重複排除されます。$ ctx_url_read("https://news.site/feed.xml")
# 取り込んだすべてのものを検索します$ lean-ctx grep "quarterly revenue"
# 必要なときに完全なオリジナルを取得できます$ ctx_retrieve(id)

導入前にチームが抱く疑問点。

コンテキストの制御を取り戻す。

ローカル利用は無料、永久に。CIが強制する。単一バイナリで、最初の測定可能な成果まで10分。

Support this project