URL to Any logoURL to Any
Back to blog
URL 转 Markdown:如何给 AI Agent 喂干净的网页内容

URL 转 Markdown:如何给 AI Agent 喂干净的网页内容

别再粘贴原始 HTML。这套一分钟 URL 转 Markdown 工作流让 AI Agent 读到干净的网页内容——并附上何时该让 Agent 直接浏览的判定规则。

Sep 5, 2026URL to Any

本周,GPT-6 Astra 让"会操作电脑的 Agent"成为主流。OpenRouter 将 OpenAI 这款新旗舰列为专为涉及计算机与浏览器操作的长程 Agent 任务打造的模型,上下文约 1M token,且可用范围正从受限早期访问向全部 Plus 用户铺开。你的 Agent 现在会浏览网页了。但这不意味着它什么都该亲自去浏览。

OpenRouter 上的 OpenAI GPT-6 Astra 页面:面向计算机与浏览器操作,1M 上下文与定价信息

来源:OpenRouter — GPT-6 Astra 模型页(2026 年 9 月 5 日访问)。

当任务需要某个具体网页的内容时,最可靠的做法仍然是最朴素的那一个:先把 URL 转成 Markdown,再把干净的文本交给 Agent。 Markdown 提取会在模型看到页面之前,就剥掉导航菜单、脚本、Cookie 横幅和样式——Agent 的注意力于是花在内容上,而不是解析标记。

这篇指南给出完整工作流:一分钟内把 URL 转成 Markdown、三种把结果交给 Agent 的方式、一次 30 秒的输出质量检查,以及一条"先转换还是让 Agent 现场浏览"的判定规则。

要点速览

  • 原始 HTML 是糟糕的 Agent 输入:大部分是模型用不上的导航、脚本和样式,长页面粘贴后还容易被截断。
  • URL 转 Markdown 不到一分钟:粘贴网址、点转换、复制干净结果。
  • 三种实用交接方式:直接粘贴进对话、存成文件给编码 Agent、汇总进上下文文档。
  • 输出要验证一次——登录墙后或重 JavaScript 的页面可能转换得很"薄"。
  • 默认先转换;只有任务需要交互、登录或实时应用时,才让 Agent 浏览。

为什么原始 HTML 对 Agent 是一顿差饭

把一个典型的产品页或文档页按原始 HTML 粘贴进去,看看你实际发送了什么:可见的正文可能只有两千词,页面源码却拖着围绕它的一整圈"装饰"——<script> 块、内联 CSS、多级导航菜单、页脚链接农场、同意横幅、统计桩代码。模型必须全部读完,才能找到你在乎的那部分。

三个问题随之而来:

  • 浪费上下文。 上下文窗口再大——Astra 这一代模型已经给到约 1M token——预算也不是白来的。标记噪声把它花在了零处。
  • 丢失结构。 HTML 把文档的骨架埋在层层嵌套的标签里。模型要靠"扫读"重建标题和列表的层级,而 Markdown 天然就有。
  • 粘贴残缺。 长 HTML 经常超出聊天框或剪贴板流程的接受范围,粘贴过去就被截断——而且往往在文档中间悄悄断掉,没有任何报错。

干净的 Markdown 一次性解决这三件事。它保留真正要紧的——标题层级、段落、列表、表格和链接——全部是纯文本;丢掉的是读者本来也看不见的一切。

工作流:不到一分钟完成 URL 转 Markdown

你不需要爬虫,也不需要本地工具链。用免费的 URL 转 Markdown 工具即可完成,无需注册:

  1. 粘贴网址到输入框。
  2. 点击转换。 页面会在几秒内抓取源码并提取内容。
  3. 检查结果面板。 Source Mode 显示原始 Markdown;Preview Mode 渲染成排版后的样子,方便你确认提取到的是正文而不是 Cookie 横幅。
  4. 复制 Markdown,或者拿走分享链接(Share Link),把完全一致的结果转给同事。

URL 转 Markdown 工具页:已输入 example.com,结果面板以 Source Mode 打开

粘贴网址,点击转换,结果面板即以 Source Mode 打开。

用这个流程转换 example.com,返回的是短短三行:一个 # Example Domain 标题、一段正文、一个链接。没有导航、没有脚本、没有样板代码——恰恰是你会希望 Agent 读到的东西。

转换结果的 Preview Mode:example.com 渲染为干净的 Markdown,仅含标题、段落和链接

Preview Mode 渲染 Markdown,让你在交给 Agent 之前确认提取质量。

还有一个便利细节:转换完成后,工具会提议把同一个网址带入相关工具——需要"干净的 HTML 本身"时用 URL to HTML,目标 Agent 更喜欢不带 Markdown 语法的纯文本时用 URL to Text。

要处理一批页面? 逐条转换,每条结果存成单独的 .md 文件,文件名写清楚内容(竞品定价.mdAPI 鉴权文档.md)。命名的文件胜过一次巨型粘贴——Agent 可以按需重读某一页,而不需要你把所有内容重新喂一遍。

把 Markdown 交给 Agent 的三种方式

转换只完成一半;交接方式决定 Agent 能不能把它用好。

1. 直接粘贴进对话。 一个页面、一个快问题,就把 Markdown 直接贴进提示词,说清楚要它做什么(“总结这几个定价档位”、“列出所有 API 参数”)。这是最快的路径,任何聊天界面都适用。

2. 存成文件给编码 Agent。 如果你用的是编码 Agent——Codex、Claude Code、Cursor,或者带终端访问能力的 Astra 一代助手——把 Markdown 存进项目里(docs/refs/ 就很好),然后把路径指给 Agent。文件式输入能撑过长会话、可按需重读,还能和它支撑的代码一起进 Git 版本管理。

3. 汇总进上下文文档。 跨多个网址做研究类任务时,把每次转换的内容按标题追加进同一份文档,标明来源 URL,再整体交给 Agent。Agent 拿到的是一份带目录的迷你语料库——比八段零散粘贴好处理得多。

30 秒输出质量检查

转换是确定的,页面不是。信任结果之前,扫一眼三件事:

  • 结构活下来了。 标题嵌套顺序正常,列表是列表,表格是表格——而不是一堆竖线段落。
  • 链接完好。 正文里的链接应该还带着 URL。如果这个页面的价值就在一组参考文献,抽查两三个。
  • 要紧的内容没丢。 不同的缺口有不同的补救:靠客户端 JavaScript 渲染内容的页面可能转出来很薄——Agent 的真实浏览器通常渲染得出来;登录墙后的内容需要一个已认证的会话,任何转换器都给不了;而防护激进的站点可能把转换和浏览两条路一起挡在门外——走哪条路,都先验证内容真的拿到了。

如果 Preview Mode 里 Markdown 看起来不对,Agent 读起来也不会对。预览存在的意义,就是让你在交接之前抓住这些。

先转换,还是让 Agent 浏览?

浏览型 Agent 正在向所有人开放,诚实的答案是:两个都用,想清楚了用。一条简单规则覆盖大多数情况:

情形 这样做 原因
公开文章、文档、定价页 先转换 一次抓取,文本干净,结构完整,可存档重读
多页研究或一批网址 逐页转换,交文件 Agent 拿到稳定语料,而不是 N 场浏览会话
任务需要登录、点击流程或查看应用实时状态 让 Agent 浏览 交互本身就是目的;提取替代不了点击
页面因客户端渲染转出来很薄 让 Agent 浏览 真实浏览器能渲染 JS,通常拿得到内容
页面在登录墙之后 用已登录会话或手动导出 只有你的账号能看的内容,转换器和全新浏览器会话都读不到
站点防护激进 走哪条路都先验证 反爬墙可能同时挡住转换器和 Agent 浏览器——确认内容真的到手

浏览即便可用也不免费——Agent 读的每一屏、点的每一下都在消耗轮次和 token,这正是我们的计算机使用 vs 结构化读取研究文详细拆解过的取舍。如果你的目标是流水线而非 Agent——RAG 摄取、知识库、内容归档——面向 LLM 数据准备的 URL 转 Markdown 指南专门讲了分块和检索。

Astra 的到来反而强化了"先转换"的习惯:约 1M token 的窗口装得下一整本书,但注意力依旧是预算。300 行干净文本交过去的页面会被认真读;同一页面的四万行标记只会被略读。

常见问题

URL 转 Markdown 会丢内容吗? 它丢的是读者本来就看不见的东西——脚本、样式、导航、广告。正文、标题、列表、表格和链接都会保留。风险场景是需要登录或重度客户端渲染的页面,这正是 30 秒预览检查存在的意义。

AI Agent 还需要浏览器操作吗? 需要——登录、多步流程、任何状态会随操作变化的场景。关键是分场景,不是站队:任务要交互就浏览,任务是阅读就转换。

转换工具免费吗? 免费。URL 转 Markdown 工具在浏览器里直接用,无需注册;相关工具(URL to Text、URL to HTML)也在同一个网站上。

收个尾

工作流短到可以背下来:粘贴网址、转成 Markdown、看一眼预览、把文件或文本交给 Agent——只有任务本身就是交互式的,才动用现场浏览。 这一周,Agent 使用电脑的能力大幅跃进;而给它们干净的输入,依然是你能控制的那一部分。

Related Articles