
在支撑人工智能应用的底层基础设施中,Markdown 正逐渐取代 JavaScript Object Notation (JSON),成为模型读取内容的默认输出格式。这一转变反映了大型语言模型(LLM)的训练机制、聊天界面的渲染逻辑,以及开发者对令牌(tokens)、上下文窗口和成本的深层考量。
Markdown 契合模型工作流
大型语言模型已在海量 Markdown 数据(如文档网站、README 文件、技术博客及知识库)上完成训练。这种高曝光度使模型能流利“理解”Markdown,将其标题、列表、表格和代码块视为语义信号而非噪声。
在用户侧,聊天界面可直接渲染 Markdown 答案,无需前端额外转换。当模型摄入 Markdown 时,其接收的信息形式与训练分布及预期响应高度一致。相比需要复杂解析的嵌套 JSON,Markdown 构建了更自然的输入-输出循环。
从令牌视角看,Markdown 去除了结构冗余,保留了核心信息载荷。对于受限于上下文窗口的 AI 智能体而言,这种效率直接转化为单次请求中更高的内容密度及更低的推理成本。
行业最佳实践的确立
向 Markdown 的迁移已体现在主流模型提供商的指导方针中。OpenAI 提示工程文档明确建议,使用 Markdown 标题(如“##”)、项目符号和表格来结构化消息,以提升模型的合规性与可读性。
第三方提示指南也遵循此模式,利用 Markdown 进行章节分隔、枚举和比较。多项分析指出,凭借更高的令牌效率及对基于文档训练模型的友好性,Markdown 已成为复杂提示的首选格式,尤其在新的 GPT-5 系列模型中表现显著。
基础设施层的共识
API 和数据提供商正纷纷提供针对 LLM 消费优化的 Markdown 变体,旨在减少令牌膨胀、简化智能体解析,并与模型的提示及展示方式保持一致。
拥有九年历史的搜索数据 API 公司 SerpApi 最近在其全部 100 多个 API 中推出了免费的 Markdown 输出功能。该功能允许开发者通过查询参数、路由扩展或标头,以 Markdown 格式请求来自 Google、Bing、YouTube 等来源的结构化洞察,专门面向 AI 智能体及 LLM 驱动的应用。
SerpApi 的基准测试显示,一次针对“coffee”的 Google 搜索,若以 JSON 返回需消耗 24,723 个令牌,而 Markdown 仅需 6,435 个,降幅达 74%;结合字段过滤后,令牌数进一步降至 1,298 个。总体而言,SerpApi 报告的平均令牌节省率约为 50%,部分端点降幅高达 90%。
搜索结果通常包含重定向链接、跟踪参数及深层嵌套元数据等“噪声”,这些并非模型推理所需。Markdown 输出则自动剥离此类干扰,仅保留标题、摘要、链接、价格和评分等核心信息,并以表格和列表形式呈现,便于直接嵌入提示或智能体记忆。
趋势展望
随着网络内容越来越多地被智能体而非人类消费,基础设施层正从“人类友好的嵌套结构”转向优化“机器可读性”。尽管 JSON 在程序化操作和严格模式执行中仍至关重要,但在 AI 工作流的上下文摄入阶段,Markdown 正成为新的默认值。
预计未来几个月,搜索、电子商务、地图和内容 API 等领域的数据提供商将广泛提供 Markdown 变体,因为令牌效率直接影响成本和性能。提示模板和智能体框架也可能标准化使用 Markdown 的章节、表格和列表,作为向模型呈现检索上下文的规范方式。
对于当前使用 LLM 开发的开发者而言,趋势已现:在向模型输入外部数据时,应优先选择与模型训练及输出方式相匹配的格式。Markdown 不再仅是文档工具,它正成为搜索数据与 AI 模型之间的新通用语。