网络垃圾消耗你的 Token 配额
导航栏、Cookie 横幅、页脚、广告:大部分抓取的页面都是样板代码,您需要为此支付嵌入费用,并再次为提示词付费。
用例 · 爬虫与抓取器
LeanCTX 将抓取的页面转换为模型就绪的上下文:ctx_url_read 摄取 HTML、PDF、RSS 和 YouTube 文稿,去除样板代码,跨页面去重并提取事实和引文。您的爬虫保持简单。在任何模型看到它之前,上下文层可将其输出缩小 60–90%。
Same engine. Different workflow. Always the right context.
导航栏、Cookie 横幅、页脚、广告:大部分抓取的页面都是样板代码,您需要为此支付嵌入费用,并再次为提示词付费。
同一篇文章出现在五个 URL 上。如果没有内容感知的去重,您将存储和处理它五次。
一个包含抓取 HTML 的文件夹不是知识库。您的智能体需要排名检索,而不是 10,000 个文件。
下方所有功能都已在开源二进制文件中交付。没有路线图项目,没有等待列表。
ctx_url_read 处理 HTML、PDF、RSS 源和 YouTube 文稿
页面折叠为可归属的事实和逐字引文
跨页面、会话和抓取任务的内容哈希去重
所有摄入的数据都可本地搜索和排名
原始内容可检索;压缩绝非死胡同
$ ctx_url_read("https://example.com/article", mode="facts")$ ctx_url_read("https://news.site/feed.xml")$ lean-ctx grep "quarterly revenue"$ ctx_retrieve(id)不会。它位于您的爬虫之后。保留 Playwright、Scrapy 或 curl;通过 LeanCTX 管道传输输出,您的模型将接收去重、压缩、可搜索的上下文,而不是原始 HTML。
HTML 页面、PDF、CSV、RSS/Atom 信息流、纯文本、电子邮件和 YouTube 脚本。每种格式在压缩前都有自己的标准化策略。
总是可以。每个原始内容都会本地存档,并通过 ctx_retrieve 进行检索。LeanCTX 中的压缩设计上是可逆的。
本地使用免费,永久免费。CI强制执行它。一个二进制文件,十分钟即可获得第一个可衡量收益。
Cookie preferences
We use analytics to understand how our site is used. You choose what's allowed — no tracking runs until you decide.
Essential
Site functionality, security, preferences
Analytics
Pageviews & usage patterns · PostHog EU (Frankfurt) · No cross-site tracking
Read our Privacy Policy for full details. You can change your preferences anytime.