Przypadek użycia · Scrapery i crawlery

Zbieraj surowo. Karmi kontekstem lean.

LeanCTX zamienia zeskrobane strony na kontekst gotowy dla modelu: ctx_url_read przetwarza HTML, PDF, RSS i transkrypty YouTube, usuwa elementy powtarzalne (boilerplate), de-duplikuje między stronami i wyodrębnia fakty oraz cytaty. Twój crawler pozostaje prosty. Warstwa kontekstu zmniejsza jego wydajność o 60–90% zanim model zobaczy dane.

Same engine. Different workflow. Always the right context.

Ile to kosztuje dzisiaj.

Webowy bałagan pochłania Twój budżet tokenów

Nawigacja, banery cookie, stopki, reklamy: większość zeskrobanej strony to elementy powtarzalne (boilerplate), za które płacisz zarówno w osadzaniu, jak i w promptach.

Duplikaty mnożą się cicho

Ten sam artykuł pojawia się na pięciu URL-ach. Bez de-duplikacji świadomej treści, przechowujesz i przetwarzasz go pięć razy.

Surowe zrzuty są nieprzeszukiwalne

Folder ze zeskrobanym HTML to nie baza wiedzy. Twój agent potrzebuje wyszukiwania rangowanego, a nie 10 000 plików.

Możliwości, które wykonują pracę.

Wszystko poniżej jest wdrożone w binarnym pliku open-source już dziś. Żadnych elementów roadmapy, żadnych list oczekujących.

Twoje narzędziaLeanCTXModel

Uniwersalne pobieranie

ctx_url_read obsługuje HTML, feedy RSS, PDF i transkrypty YouTube

Tryby faktów i cytatów

strony sprowadzają się do przypisywalnych faktów i dosłownych cytatów

De-duplikacja

dedupowanie na podstawie hasha treści w różnych stronach, sesjach i zeskrobowaniach

BM25 + wyszukiwanie grafowe

wszystko, co zostanie pobrane, staje się lokalnie wyszukiwalne i możliwe do rankingu

Lokalne archiwum

oryginały pozostają dostępne; kompresja nigdy nie jest ślepym zaułkiem

Od zera do pierwszego zysku.

terminal
# przyjmowanie strony jako przypisywalnych faktów$ ctx_url_read("https://example.com/article", mode="facts")
# przyjmowanie strumienia; elementy docierają z datą i są de-duplikowane$ ctx_url_read("https://news.site/feed.xml")
# wyszukiwanie wszystkiego, co zostało przyjęte$ lean-ctx grep "quarterly revenue"
# odzyskanie pełnego oryginału w razie potrzeby$ ctx_retrieve(id)

Pytania, które zespoły zadają przed wdrożeniem.

Odzyskaj kontrolę nad swoim kontekstem.

Darmowe do lokalnego użytku, na zawsze. CI to egzekwuje. Jeden binarny plik, dziesięć minut do pierwszego zmierzonego zysku.

Support this project