웹 쓰레기가 토큰 예산을 소모합니다
탐색, 쿠키 배너, 푸터, 광고: 스크랩된 페이지의 대부분은 임베딩 비용을 지불하고 프롬프팅에 다시 지불해야 하는 보일러플레이트입니다.
사용 사례 · 스크래퍼 및 크롤러
LeanCTX는 스크랩된 페이지를 모델이 사용할 수 있는 컨텍스트로 변환합니다: ctx_url_read가 HTML, PDF, RSS 및 YouTube 트랜스크립트를 가져와 보일러플레이트 코드를 제거하고, 페이지 간 중복을 제거하며, 사실과 인용구를 추출합니다. 크롤러는 단순하게 유지하세요. 이 컨텍스트 레이어가 모델이 보기 전에 출력 크기를 60–90% 줄여줍니다.
Same engine. Different workflow. Always the right context.
탐색, 쿠키 배너, 푸터, 광고: 스크랩된 페이지의 대부분은 임베딩 비용을 지불하고 프롬프팅에 다시 지불해야 하는 보일러플레이트입니다.
같은 기사가 다섯 개의 URL에 나타납니다. 콘텐츠 인식 중복 제거가 없으면 이를 다섯 번 저장하고 처리해야 합니다.
스크랩된 HTML 폴더는 지식 기반이 아닙니다. 에이전트는 10,000개의 파일이 아닌 순위가 매겨진 검색을 필요로 합니다.
아래 모든 것은 오늘 오픈 소스 바이너리에 포함됩니다. 로드맵 항목도, 대기 목록도 없습니다.
ctx_url_read는 HTML, PDF, RSS 피드 및 YouTube 트랜스크립트를 처리합니다
페이지가 출처가 명시된 사실과 정확한 인용구로 압축됩니다
페이지, 세션 및 크롤링 전반에 걸쳐 콘텐츠 해시 중복 제거를 수행합니다
수집된 모든 것이 로컬에서 검색하고 순위를 매길 수 있게 됩니다.
원본은 검색 가능하며, 압축은 결코 막다른 길이 아닙니다
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)아닙니다. 스크래이퍼 뒤에 위치합니다. Playwright, Scrapy 또는 curl을 유지하고 출력을 LeanCTX로 파이프하여 모델은 원시 HTML 대신 중복 제거되고 압축되며 검색 가능한 컨텍스트를 받습니다.
HTML 페이지, PDF, CSV, RSS/Atom 피드, 일반 텍스트, 이메일 및 YouTube 스크립트. 각 형식은 압축 전에 자체 정규화 전략을 가집니다.
항상 가능합니다. 모든 원본은 로컬에 아카이브되며 ctx_retrieve를 통해 검색할 수 있습니다. LeanCTX의 압축은 설계상 가역적입니다.
로컬 사용에 한해 영구적으로 무료입니다. CI가 이를 강제합니다. 하나의 바이너리로, 첫 측정 가능한 이득까지 단 10분.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.