YISUKE AI ENGINE · TECHNICAL ARCHITECTURE

医速课 AI 制课引擎六层多模态课程生成流水线 · Multi-Agent Course Generation Pipeline

从医生的原始素材(论文、讲稿、录音、视频、网页)到一门可售卖的结构化课程, 引擎在分钟级时间内完成跨模态理解、知识蒸馏、课程规划与并行内容生成, 并以 Human-in-the-loop 审校闭环保证医学内容的专业性底线。

~3s

大纲首 token 延迟

课程内容并行度

<¥1

单门课程生成成本

>99%

结构化解析成功率

01 · 端到端生成流水线

End-to-End Pipeline —— 每一层职责单一、可独立降级,任意一层故障不产生跨层级联失效

L1

多模态素材接入层

Multimodal Ingestion Layer

对医生投喂的异构素材做统一收敛:MIME 嗅探与类型路由、二进制 Base64 封装、网页 DOM 降噪抽取正文、超长文本窗口截断(40K chars/源),并保留文件名语义作为解析失败时的兜底信号。

PDF · OCR-free 文档理解音频 · 原生声学 token 化视频 · 1fps 帧采样 + 音轨图像 · Vision Encoder网页 · DOM 清洗 / 正文抽取MIME 嗅探路由Base64 Data-URI 封装
L2

模型网关与智能路由层

Model Gateway & Routing Layer

所有推理请求经统一网关(OpenRouter)出口。针对上游供应商的区域可用性差异做 Provider Pinning(google-vertex 优先),配合逐级降级链与区域熔断,保证任何单点供应商故障不阻断生成链路。

OpenRouter 统一网关Provider Pinning (google-vertex)区域可用性熔断 (403 Breaker)模型降级链 Gemini → QwenReasoning Budget 控制SSE 流式转发
L3

多模态理解与蒸馏层

Understanding & Distillation Layer

主模型在 1M token 上下文窗口内对全部素材做跨模态联合理解,产出两类中间产物:面向用户的流式思考轨迹(Streaming CoT Surfacing),以及面向下游的素材蒸馏摘要(Source Distillation,800–1200 字高密度知识底稿)。

1M Context 跨模态联合理解Streaming CoT SurfacingSource Distillation(素材蒸馏)受众感知调制 (Audience Conditioning)关键事实/数据/案例线索保留
L4

课程规划层

Curriculum Planning Layer

规划 Agent 基于蒸馏底稿与目标人群画像,生成课程骨架:标题、营销级课程简介、标签体系与 N 节课的主题序列,以结构化 JSON Schema 约束输出,经容错解析器(Fenced-JSON Recovery)落地为可编辑草稿。

Outline Planning AgentJSON Schema 约束输出Fenced-JSON Recovery 容错解析课程难度梯度编排Human-in-the-loop 大纲编辑
L5

内容生成层(并行 Agent 池)

Parallel Generation Layer

每节课由独立生成 Agent 负责,4 路并发调度(Bounded Concurrency Pool),共享蒸馏底稿实现上下文压缩复用(省去逐课重传原始素材的开销)。单节失败可独立重试,互不阻塞。

Per-Lesson Generation Agent × N4-way Bounded Concurrency上下文压缩复用(Digest as Context)学习目标 / 千字正文 / 场景案例3 题 Quiz 自动命题 + 干扰项设计单节粒度重试与再生成
L6

规范化与人机协同层

Normalization & HITL Layer

生成产物经 Schema 规范化(字段裁剪、答案下标钳制、选项数校验)后进入医生审校工作台:全字段可编辑、正确答案可重标、整节可重新生成。医生确认后一键发布,AI 只做初稿,专业性由医生最终背书。

Schema NormalizationAnswer-Index Clamping医生全字段审校(HITL)单节重生成一键上架发布

02 · 模型选型矩阵

Model Selection Matrix —— 选型四维评估:模态覆盖 × 上下文容量 × 延迟/成本 × 供应链可用性

主力引擎

google/gemini-2.5-flash

多模态理解 · 素材蒸馏 · 大纲规划 · 课程生成

唯一同时满足「原生音视频理解 + 1M 上下文 + 亚秒级首 token + 低于 $0.3/M 输入」四项硬指标的模型;OCR-free 直读 PDF 图表,省去自建解析管线。

原生多模态(文/图/音/视频)
1M token 上下文
$0.30 / M input tokens
Provider: google-vertex
降级引擎

qwen/qwen3.6-flash

主链路不可用时的全自动接管

图文视频多模态、中文语料占优、成本仅为主模型 60%、国内网络可达性最好——作为容灾引擎,牺牲音频理解换取链路永不中断。

图/文/视频多模态
中文生成质量优
$0.19 / M input tokens
Provider: Alibaba

请求级容灾路由Region-aware Failover Routing

生成请求outline / lessonOpenRouter 网关Provider Pinningreasoning: disabledgoogle-vertex主通道 · Pinnedgoogle-ai-studio403 REGION_BLOCKED · 熔断Gemini 2.5 FlashPrimary EngineQwen3.6 FlashFallback Enginenon-2xx 自动降级

03 · 关键工程机制

Key Engineering Mechanisms —— 决定生成速度、成本与可靠性的六个设计决策

Reasoning Budget 调控

推理型模型默认的隐式思考(thinking tokens)会带来 40–60 秒的流式静默。生成链路显式关闭 reasoning budget,将首 token 延迟压至 2 秒内,思考过程改由提示词工程显式外化为可视化轨迹。

🧪

Source Distillation

大纲阶段一次性消化全部原始素材(可达数百 MB 多模态输入),蒸馏为 800–1200 字知识底稿。后续 N 节课并行生成全部复用底稿,上下文开销从 O(N×素材) 降为 O(N×1K 字),成本下降一个数量级。

🛰

区域感知容灾路由

google-ai-studio 供应商在部分区域返回 403 REGION_BLOCKED。网关层对 google 系模型强制 Provider Pinning 至 vertex 通道,请求级失败自动切换降级链,全程对上层业务透明。

🧵

流式思考外化

大纲生成采用 SSE 全链路透传:模型被约束先输出逐行分析轨迹(▸ 前缀协议),再输出 ===OUTLINE=== 分隔符与结构化 JSON。前端按协议增量渲染,用户看到的「AI 正在思考」即模型真实输出。

🧩

容错 JSON 解析

LLM 结构化输出存在 code-fence 包裹、前后缀噪声等不确定性。解析器采用括号配对回收策略(首 { 至末 } 切片 + fence 剥离 + 字段级规范化),实测解析成功率 >99%,失败自动触发单节重试。

👩‍⚕️

Human-in-the-loop

医学内容零容错。AI 产物全部以「草稿」形态进入医生审校台,大纲可增删改序、正文案例逐字可编、Quiz 正确项可重标;未经医生确认的内容永远不会触达学员。

一门 8 节课(含 24 道 Quiz、约 30 个临床案例、8000+ 字正文)的端到端生成:约 40 秒·成本不足 1 元·医生审校后上架

* 本页为演示环境的技术说明,数据为该环境实测量级