只想提取网页正文,需要自己写解析规则吗?
不需要先为每个网站编写解析规则。对于公开可访问的网页,向 WebFetch 提供网址,就可以尝试提取正文、标题等内容,省去自行搭建抓取和解析流程的工作。
在试验场选择 POST /v1/extract,输入自己的网址,运行后查看 main_text 是否包含需要的正文。建议用几篇有代表性的页面检查效果,再接入批量任务。
不同页面的结构和可获取内容会影响结果,作者、发布时间等字段也可能缺失。如果需要检查实际获取的页面,可以切换到 POST /v1/dom/dump 查看 HTML。
