如何高效抓取 IBM 文档网站的动态目录结构(无需 Selenium)

如何高效抓取 IBM 文档网站的动态目录结构(无需 Selenium)

本文介绍一种绕过 javascript 动态渲染、直接调用 ibm 官方文档 api 获取完整目录树的方法,避免使用 selenium 等重量级工具,大幅提升爬取效率与稳定性。

本文介绍一种绕过 javascript 动态渲染、直接调用 ibm 官方文档 api 获取完整目录树的方法,避免使用 selenium 等重量级工具,大幅提升爬取效率与稳定性。

IBM 官方文档站点(如 https://www.php.cn/link/116dc4b9cd1faf32bc3bb9d47be29a22)采用前端动态加载技术,左侧导航栏由 JavaScript 控制展开/折叠,传统 BeautifulSoup 无法直接解析隐藏内容。若强行使用 Selenium 模拟点击逐层展开,不仅开发复杂、运行缓慢,还易因 DOM 变更或反自动化策略失败。

幸运的是,IBM 文档系统提供了公开的 RESTful 目录 API,可直接获取结构化 JSON 数据,完全规避前端渲染问题。该 API 地址格式为:

https://www.ibm.com/docs/api/v1/toc/{product}/{version}?lang={lang}

例如目标文档对应 URL 为:
https://www.ibm.com/docs/api/v1/toc/b2b-integrator/6.1.0?lang=en

以下是一段轻量、可靠、可复用的 Python 实现:

import json
import requests

def fetch_and_print_toc(product="b2b-integrator", version="6.1.0", lang="en"):
    """获取并递归打印 IBM 文档目录树"""
    api_url = f"https://www.ibm.com/docs/api/v1/toc/{product}/{version}?lang={lang}"

    try:
        response = requests.get(api_url, timeout=10)
        response.raise_for_status()
        data = response.json()

        def traverse(node, level=0):
            indent = "\t" * level
            label = node.get("label", "Untitled")
            href = node.get("href", "")
            print(f"{indent}{label} -> {href}")

            # 递归遍历子主题
            for child in node.get("topics", []):
                traverse(child, level + 1)

        # 从根节点 toc 开始遍历
        if "toc" in data:
            traverse(data["toc"])
        else:
            print("Unexpected API response structure:", json.dumps(data, indent=2)[:200])

    except requests.exceptions.RequestException as e:
        print(f"请求失败: {e}")
    except json.JSONDecodeError as e:
        print(f"JSON 解析错误: {e}")

# 调用示例
fetch_and_print_toc()

优势总结

  • 零浏览器依赖:无需安装 ChromeDriver 或配置 Selenium;
  • 毫秒级响应:API 返回纯 JSON,比渲染页面快 10 倍以上;
  • 结构清晰:label(标题)、href(相对路径)、topics(嵌套子项)字段语义明确;
  • 易于扩展:可轻松导出为 Markdown、CSV 或存入数据库;支持批量抓取多版本/多产品文档。

⚠️ 注意事项

  • 请遵守 robots.txt 及 IBM 官网《使用条款》,建议添加 User-Agent 头并控制请求频率;
  • href 字段为相对路径,拼接基础域名后即可构成完整 URL(如 https://www.ibm.com/docs/en/ + SS3JSW_6.1.0/ReleaseNotes.html);
  • 若需抓取页面正文内容,可在获取所有 href 后,对每个 URL 发起独立 GET 请求(仍推荐 requests + BeautifulSoup 组合,而非 Selenium);
  • 部分旧版文档可能未开放 API,此时再考虑 Puppeteer/Selenium 方案作为备选。

该方法体现了现代网页抓取的核心原则:优先寻找结构化数据源,而非硬啃渲染结果。对于 IBM、Red Hat、Microsoft Docs 等大型技术文档站,其后台 API 往往是更优雅、更可持续的解决方案。

文章来自机圈观察员网,发布者:,转载请注明出处:https://www.jqgcy.com/xitongjiaocheng/127099.html

上一篇 2026-07-19 23:39
下一篇 2026-07-19 23:39

相关推荐