Web çamuru token bütçenizi tüketir
Navigasyon, çerez bannerları, alt bilgiler, reklamlar: kazınmış bir sayfanın çoğu, gömmek için ödediğiniz ve istemde tekrar ödediğiniz standart kısımdır.
Kullanım senaryosu · Kazıyıcılar ve tarayıcılar
LeanCTX, kazınmış sayfaları model için hazır bağlama dönüştürür: ctx_url_read HTML, PDF, RSS ve YouTube transkriptlerini alır, standart kısımları temizler, sayfa genelinde yinelenmeyi ortadan kaldırır ve gerçekleri ile alıntıları çıkarır. Kazıyıcınız basit kalır. Bağlam katmanı, model herhangi bir şey görmeden önce çıktısını %60–90 küçültür.
Same engine. Different workflow. Always the right context.
Navigasyon, çerez bannerları, alt bilgiler, reklamlar: kazınmış bir sayfanın çoğu, gömmek için ödediğiniz ve istemde tekrar ödediğiniz standart kısımdır.
Aynı makale beş URL'de görünür. İçerik farkındalıklı yinelenme giderme olmadan, onu beş kez depolarlar ve işlersiniz.
Kazınmış HTML'den oluşan bir klasör bir bilgi tabanı değildir. Aracınız 10.000 dosya yerine sıralı arama gerektirir.
Aşağıdakilerin her şeyi bugün açık kaynaklı ikili dosyada yayınlanıyor. Yol haritası öğesi yok, bekleme listesi yok.
ctx_url_read HTML, PDF beslemeleri ve YouTube transkriptlerini işler
sayfalar atfedilebilir gerçeklere ve kelimesi kelimesine alıntılara çöker
content-hash, sayfalar, oturumlar ve kazıma işlemleri genelinde yinelenmeyi giderir
alınan her şey yerel olarak aranabilir ve sıralanabilir hale gelir
orijinaller erişilebilir kalır; sıkıştırma asla bir çıkmaz değildir
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Her alım formatı ve nasıl normalize edildiği.
Daha fazla bilgi edininURL'den alıntılanan cevaba, uçtan uca.
Daha fazla bilgi edininAlınan içeriğin nasıl kalıcı olduğu ve sıralandığı.
Daha fazla bilgi ediningerçekler, alıntılar, entropi ve arkadaşlar.
Daha fazla bilgi edininHayır. Scraper'ınızdan sonra yerleşir. Playwright, Scrapy veya curl kullanmaya devam edin; çıktıyı LeanCTX üzerinden geçirerek modellerin ham HTML yerine yinelenme giderilmiş, sıkıştırılmış ve aranabilir bir bağlam almasını sağlayın.
HTML sayfaları, PDF'ler, CSV, RSS/Atom akışları, düz metin, e-posta ve YouTube transkriptleri. Her formatın sıkıştırmadan önce kendi normalleştirme stratejisi vardır.
Her zaman. Her orijinal yerel olarak arşivlenir ve ctx_retrieve aracılığıyla erişilebilir. LeanCTX'teki sıkıştırma tasarımsal olarak tersine çevrilebilir.
Yerel kullanım için ücretsiz, sonsuza kadar. CI zorunlu kılar. Tek bir ikili, ilk ölçülebilir kazanca on dakika.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.