
Qwen3.8-Omni-Flash 上线:把网页转成 Markdown/JSON 喂给多模态模型
Qwen3.8-Omni-Flash 支持文本、图像、音频、视频输入与 1M 上下文,每小时音频输入价格下降超 98%。什么时候把网页转成 Markdown、什么时候转 JSON?浏览器免费完成,无需安装。
Qwen 发布了新的原生全模态模型:文本、图像、音频、视频都是一等输入,上下文窗口拉到 1M token,每小时音频输入的价格降了 98% 以上。对要把网页内容喂给模型的人来说,问题的一半——模型侧的成本——正被快速解决;另一半还留着:你的资料仍然以网页和 PDF 的形式存在,而 URL 本身没法直接粘进 API。这篇文章讲清楚 Qwen3.8-Omni-Flash 真正改变了什么,再补上多数教程跳过的那一步:把网页转成模型管线真正能用的 Markdown 或 JSON,并给出两种格式各自适用的判断标准。
Qwen3.8-Omni-Flash 带来了什么
Qwen 于 2026 年 9 月 18 日发布该模型,现已在千问 AI 平台上线。以下是官方公告中的关键事实:
- 原生全模态输入。 文本、图像、音频、视频都作为一等输入直接进入模型,不需要经过一串转换工具拼装。
- 1M token 长上下文。 长文档、会议记录、成批的网页可以装进一次请求。
- 输入价格大幅下调。 与上一代相比,每小时音频输入价格下降超过 98%,每小时音视频输入价格下降超过 93%(博客脚注说明了口径:每小时价格按 2 分钟素材成本乘以 30 估算,视频按 720p、1 fps 计算)。
- 面向 Agent 的能力提升。 Qwen 披露在累计 29 项评测中平均得分相比 Qwen3.5-Omni-Plus 提升超过 25%,多模态工具调用基准提升显著,例如 WildClawBench-MM 从 34.5 升至 71.0。这些是厂商报告的数字,不是独立评测。
- 配套的实时与工具生态。 同步推出面向实时音视频交互的 Qwen3.8-Omni-Flash-Realtime;Qwen 还开源了 Qwen-MM-Plugins(其中的 Video2Note 可以把长视频压缩成图文 PDF 笔记)和 Qwen-Live Harness 运行环境。
实际含义很直接:过去因为价格做不了的工作负载——把数小时的会议录音、课程或屏幕录像和文档一起喂给模型——现在装得进正常预算。模型原生支持单次最长一小时的视频会议输入,模型侧自己拆掉了大部分成本门槛。

真正的瓶颈是你的资料
差距在这里:模型能直接读音频和视频了,但互联网不会只以音视频的形式给你内容。一个典型的项目要引用博客文章、价格页、API 文档、PDF 和后台数据——它们全都是 HTML 或文档文件。原始 HTML 是最不该放进提示词的东西之一:导航栏、脚本和排版标记消耗 token,却不提供模型需要的任何信息。
Markdown 和 JSON 仍然是"互联网上的一个页面"和"模型可用的输入"之间的桥:
- Markdown 保留真正重要的结构——标题、列表、表格、链接——token 成本接近纯文本。凡是模型要读的内容,用它。
- JSON 把页面变成程序能用的字段。凡是你的代码要消费的内容,用它。
这次发布改变的是这类决策的分量,而不是决策本身。更便宜的多模态输入意味着你会组装更大的上下文——更多页面,外加录音录像——每种素材以什么格式进场,决定了省下的预算是花在内容上还是浪费在标记上。
Markdown 还是 JSON:按任务选
选择取决于输出的消费者是谁,而不是模型有多大:
| 你要做的事 | 喂给模型的格式 | 原因 |
|---|---|---|
| 总结、简报、基于网页的问答 | Markdown | 结构保留、token 便宜,模型引用起来干净 |
| RAG 或知识库入库 | Markdown | 按标题自然分块,向量化效果好 |
| 提取特定字段(价格、参数、日期、实体) | JSON | 输出直接对接代码、表格或数据库 |
| 监控会变化的页面 | JSON | 对结构化字段做 diff,比比对正文可靠 |
| 把文稿或报告与音视频一起喂给模型 | 文本用 Markdown,音视频走原生输入 | 每种格式发挥各自模态的长处 |
一条实用的规则:模型之后由人来读,用 Markdown;由脚本处理,用 JSON。同一个 URL 两种格式都能产出,不必一次定终身——按管线选择即可。
五分钟的工作流
下面的步骤刻意保持简短;重点在于它们如何嵌入多模态管线,而不是工具操作本身。
- 收集规范 URL。 一个信源一个 URL——用文章页而不是列表页,用文档对应章节而不是文档首页。
- 阅读类任务转 Markdown。 把 URL 粘进转换工具,取 Markdown 输出。URL to Any 的网页转 Markdown 工具在浏览器里完成,无需注册和安装,标题、表格、链接都会保留。
- 代码消费的场景转 JSON。 提取类任务把同一个 URL 交给网页转 JSON 工具,拿回结构化内容。

用 URL to Any 的网页转 Markdown 工具转换维基百科条目:标题、链接和列表都转换为干净的 Markdown(来源:en.wikipedia.org)。
- 喂之前先修剪。 通读输出,删掉残留的导航、Cookie 横幅和相关文章块。保留标题骨架——1M 上下文装得下冗长的资料,但检索质量仍然取决于干净的段落结构。
- 组装上下文。 这一步是发布真正兑现价值的地方:Markdown 格式的文档页、JSON 格式的价格表,再加上作为原生视频输入的产品演示,可以进同一次请求。按角色配格式——文字做参照,音视频补足只有录像才记录的内容。

同一信源 URL 转换为结构化 JSON,供程序消费(来源:en.wikipedia.org)。
新的价格结构解锁了什么
以下按规划思路陈述,而非实测结论——本文引用的基准数据来自 Qwen 官方,你的实际负载会有差异:
- 文档加演示。 把书面指南转成 Markdown,和它演示的视频一起发给模型,让回答同时对照操作步骤和实际屏幕录像。
- 会议管线。 一小时录音走原生输入,议程、项目页和历史会议纪要以 Markdown 进场——纪要和待办同时落在所有信源上。
- 定时监控。 竞品页面和价格页定时转成 JSON;字段级 diff 直接呈现变化,不必每次让模型通读整页。
共同点在于:转换是便宜且确定的一步,它让昂贵且不确定的一步——模型调用——配得上它新低的价格。
值得知道的边界
几条边界帮助预期保持诚实:
- 价格下调覆盖的是每小时音频与音视频输入相对上一代的降幅;公告没有给出按 token 计的文本价格,文本为主的预算仍需单独测算。
- 基准数字为厂商报告。把能力声明当作自己评测的起点,而不是结论。
- 转换工具只能处理公开可访问的页面。登录墙和重度脚本化的应用不在范围内,工具取不到页面时应当如实报告,而不是猜测。
- 把别人的内容喂给模型,不改变你对这些内容本来的义务——版权与使用条款依然适用。
结论
Qwen3.8-Omni-Flash 把多模态输入的成本线大幅推低,并让录音录像可以和文档同处一个上下文。模型侧不再是借口,剩下的工作是准备:把需要的页面转成 Markdown 或 JSON,每个信源大约一分钟——这决定了你新近变得便宜上下文,是花在内容上,还是花在标记上。
如果你正在组装上下文,URL to Any 在浏览器里免费完成网页转 Markdown、JSON 等格式转换——无需注册。
Related Articles

PDF 转 Markdown:LiteParse 9 月更新改变了什么
LiteParse 2.14.6 将 PDF 文本提取耗时缩短 20–25%,三个基准的表格准确率全面提升,并新增块级视觉定位与 is-complex 路由 API。解读这些厂商自报数据,并给出如何选择 PDF 转 Markdown 方案的决策标准。

Cloudflare「禁止 AI 训练」新规:网页转 Markdown 工作流要注意什么
Cloudflare 的 Disallow AI Training 设置把搜索收录与 AI 训练解耦。这次爬虫新政对网页转 Markdown 提取意味着什么,抓取工作流又该怎么调整。

AI Agent 是怎么读网页的:Markdown 内容协商、WebMCP 与 10 秒自检
AI Agent 通过普通 HTTP 读取你的网页。讲清 Accept: text/markdown 内容协商的原理、哪些 Agent 真正支持、WebMCP 带来什么改变,以及如何 10 秒检查任意 URL。