ThinSpider 是面向工程师的多租户云采集引擎:静态页 / 列表详情 / SPA 渲染 / API 接口 / 文档附件,控制台向导或 REST API 双通道提交,隔离 worker 池稳定采集,结果 JSON / CSV / Webhook 直出。
# 单页 → Markdown / 结构化 JSON(Firecrawl 风格,即拷即用) curl -X POST https://thinspider.thinkalike.com.cn/v1/scrape \ -H "Authorization: Bearer ts-xxxxxxxx" -H "Content-Type: application/json" \ -d '{"url": "https://example.com/news", "formats": ["markdown"]}' # 整站采集:BFS + 翻页 + 定时增量,异步任务随时查 curl -X POST https://thinspider.thinkalike.com.cn/v1/crawl \ -H "Authorization: Bearer ts-xxxxxxxx" -d '{"url": "https://example.com", "depth": 2, "limit": 200}' # 复杂结构交给任务 DSL:列表选择器 + 字段映射 + 降级策略 + cron POST /api/tasks { "dsl": { "list_rule": {...}, "detail_fields": {...}, "downgrade_policy": ["http","render","stealth","proxy"], "schedule": "0 3 * * *" } }
五种目标形态、一套契约——描述你要什么,引擎决定怎么拿
列表选择器 + 详情字段映射 + 翻页规则,新闻、目录、电商 SKU 结构化落表,URL 归一 + 内容指纹双去重,重复跑零增量。
crawl4ai + Playwright 浏览器进程池,context 复用与强制回收防泄漏;默认屏蔽图片/字体资源,单页 1.5MB → 250KB,吞吐 ×5。
把返回 JSON 的接口当一等公民:翻页参数模板、鉴权头透传、字段抽取映射,无需先转页面再解析。
PDF / Word / Excel 附件随页采集入对象存储,直出下载链接,采集不再只拿正文。
visitToken 类 JS Cookie 挑战自动补种重试、SSL/编码兜底——来自生产环境千锤百炼的取页逻辑。
cron 表达式驱动,列表页时间水位 + sha256 指纹,只抓新不重抓;结果 Webhook 推送到你的系统。
不承诺"无条件突破任何站点",承诺"每次尝试都可复盘" —— 失败原因精确到步骤
每步尝试写入 runs 事实台账(step / ok / note),成功路径自动固化为任务策略;跨租户同域礼貌锁防止把目标站打成 DDoS,SSRF 三重防线保住平台自身。
提交后 1 个工作日内审核开通;开通后用 UC 账号登录控制台
静态内容页、列表+详情结构、翻页、SPA 前端渲染站点、返回 JSON 的 API 接口、文档附件均可。通过声明式任务 DSL 描述目标结构,控制台向导或开放 API 双通道提交。
引擎按声明式降级链逐级尝试:HTTP 直取 → 无头渲染 → 真实化浏览器 → 代理升级 → 验证码通道(仅用户自有账号场景、需显式开通并留审计)。每一步写入事实台账,失败可定位、不静默兜底。
不会。同域礼貌锁合并 crawl-delay、每租户在途上限、加权公平调度三重约束;黑名单域名库(付费墙/政务敏感/医疗/金融凭证类)默认禁抓。用户协议明确禁止绕付费墙与破解凭证,滥用即吊销。
结构化 JSON / CSV 落对象存储,控制台在线预览下载,或 Webhook 推送到你的系统;原始件走 OSS+CDN 直出,大文件下载不占你带宽。
SaaS 版无需部署。私有化实例的授权激活见 激活页,许可签发与更新指南见 SN 平台 THINSPIDER 指南。