Dữ liệu web rác làm tiêu hao ngân sách token của bạn
Điều hướng, banner cookie, chân trang, quảng cáo: hầu hết một trang được scrape là boilerplate mà bạn phải trả tiền nhúng và lại phải trả tiền để prompt.
Trường hợp sử dụng · Trình thu thập & crawler
LeanCTX biến các trang được scrape thành ngữ cảnh sẵn sàng cho mô hình: ctx_url_read xử lý HTML, PDF, RSS và bản ghi YouTube, loại bỏ phần boilerplate, khử trùng lặp giữa các trang và trích xuất sự kiện cùng trích dẫn. Crawler của bạn vẫn đơn giản. Lớp context layer giúp giảm kích thước đầu ra từ 60–90% trước khi bất kỳ mô hình nào thấy nó.
Same engine. Different workflow. Always the right context.
Điều hướng, banner cookie, chân trang, quảng cáo: hầu hết một trang được scrape là boilerplate mà bạn phải trả tiền nhúng và lại phải trả tiền để prompt.
Cùng một bài viết xuất hiện trên năm URL. Nếu không có khử trùng lặp nhận biết nội dung, bạn sẽ lưu trữ và xử lý nó năm lần.
Một thư mục HTML được scrape không phải là một cơ sở kiến thức. Agent của bạn cần truy xuất xếp hạng, chứ không phải 10.000 tệp tin.
Mọi thứ bên dưới đều được tích hợp trong binary mã nguồn mở ngay hôm nay. Không mục roadmap, không danh sách chờ.
ctx_url_read xử lý HTML, nguồn cấp RSS và bản ghi YouTube
các trang được nén thành các sự kiện có thể quy cho tác giả và các trích dẫn nguyên văn
khử trùng lặp bằng content-hash trên nhiều trang, phiên và lần crawl
mọi thứ được nạp vào đều có thể tìm kiếm cục bộ và xếp hạng được
nguồn gốc vẫn có thể truy xuất; nén không bao giờ là điểm mù
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)Mọi định dạng đầu vào và cách chúng được chuẩn hóa.
Tìm hiểu thêmTừ URL đến câu trả lời trích dẫn, toàn bộ quy trình.
Tìm hiểu thêmCách nội dung đã nhập được lưu trữ và xếp hạng.
Tìm hiểu thêmcác sự kiện, trích dẫn, entropy và bạn bè.
Tìm hiểu thêmKhông. Nó nằm sau scraper của bạn. Hãy giữ Playwright, Scrapy hoặc curl; truyền đầu ra qua LeanCTX và các mô hình của bạn sẽ nhận được ngữ cảnh đã khử trùng lặp, nén và có thể tìm kiếm thay vì HTML thô.
Trang HTML, PDF, CSV, feed RSS/Atom, văn bản thuần túy, email và bản ghi YouTube. Mỗi định dạng có chiến lược chuẩn hóa riêng trước khi nén.
Luôn luôn. Mọi nguồn gốc đều được lưu trữ cục bộ và có thể truy xuất qua ctx_retrieve. Việc nén trong LeanCTX là khả nghịch theo thiết kế.
Miễn phí sử dụng cục bộ, mãi mãi. CI thực thi nó. Một binary, mười phút để đạt được lợi ích đo lường đầu tiên.
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.