YISUKE AI ENGINE · TECHNICAL ARCHITECTURE
医速课 AI 制课引擎六层多模态课程生成流水线 · Multi-Agent Course Generation Pipeline
从医生的原始素材(论文、讲稿、录音、视频、网页)到一门可售卖的结构化课程, 引擎在分钟级时间内完成跨模态理解、知识蒸馏、课程规划与并行内容生成, 并以 Human-in-the-loop 审校闭环保证医学内容的专业性底线。
~3s
大纲首 token 延迟
4×
课程内容并行度
<¥1
单门课程生成成本
>99%
结构化解析成功率
01 · 端到端生成流水线
End-to-End Pipeline —— 每一层职责单一、可独立降级,任意一层故障不产生跨层级联失效
多模态素材接入层
Multimodal Ingestion Layer对医生投喂的异构素材做统一收敛:MIME 嗅探与类型路由、二进制 Base64 封装、网页 DOM 降噪抽取正文、超长文本窗口截断(40K chars/源),并保留文件名语义作为解析失败时的兜底信号。
模型网关与智能路由层
Model Gateway & Routing Layer所有推理请求经统一网关(OpenRouter)出口。针对上游供应商的区域可用性差异做 Provider Pinning(google-vertex 优先),配合逐级降级链与区域熔断,保证任何单点供应商故障不阻断生成链路。
多模态理解与蒸馏层
Understanding & Distillation Layer主模型在 1M token 上下文窗口内对全部素材做跨模态联合理解,产出两类中间产物:面向用户的流式思考轨迹(Streaming CoT Surfacing),以及面向下游的素材蒸馏摘要(Source Distillation,800–1200 字高密度知识底稿)。
课程规划层
Curriculum Planning Layer规划 Agent 基于蒸馏底稿与目标人群画像,生成课程骨架:标题、营销级课程简介、标签体系与 N 节课的主题序列,以结构化 JSON Schema 约束输出,经容错解析器(Fenced-JSON Recovery)落地为可编辑草稿。
内容生成层(并行 Agent 池)
Parallel Generation Layer每节课由独立生成 Agent 负责,4 路并发调度(Bounded Concurrency Pool),共享蒸馏底稿实现上下文压缩复用(省去逐课重传原始素材的开销)。单节失败可独立重试,互不阻塞。
规范化与人机协同层
Normalization & HITL Layer生成产物经 Schema 规范化(字段裁剪、答案下标钳制、选项数校验)后进入医生审校工作台:全字段可编辑、正确答案可重标、整节可重新生成。医生确认后一键发布,AI 只做初稿,专业性由医生最终背书。
02 · 模型选型矩阵
Model Selection Matrix —— 选型四维评估:模态覆盖 × 上下文容量 × 延迟/成本 × 供应链可用性
google/gemini-2.5-flash
多模态理解 · 素材蒸馏 · 大纲规划 · 课程生成
唯一同时满足「原生音视频理解 + 1M 上下文 + 亚秒级首 token + 低于 $0.3/M 输入」四项硬指标的模型;OCR-free 直读 PDF 图表,省去自建解析管线。
qwen/qwen3.6-flash
主链路不可用时的全自动接管
图文视频多模态、中文语料占优、成本仅为主模型 60%、国内网络可达性最好——作为容灾引擎,牺牲音频理解换取链路永不中断。
请求级容灾路由Region-aware Failover Routing
03 · 关键工程机制
Key Engineering Mechanisms —— 决定生成速度、成本与可靠性的六个设计决策
⚡
Reasoning Budget 调控
推理型模型默认的隐式思考(thinking tokens)会带来 40–60 秒的流式静默。生成链路显式关闭 reasoning budget,将首 token 延迟压至 2 秒内,思考过程改由提示词工程显式外化为可视化轨迹。
🧪
Source Distillation
大纲阶段一次性消化全部原始素材(可达数百 MB 多模态输入),蒸馏为 800–1200 字知识底稿。后续 N 节课并行生成全部复用底稿,上下文开销从 O(N×素材) 降为 O(N×1K 字),成本下降一个数量级。
🛰
区域感知容灾路由
google-ai-studio 供应商在部分区域返回 403 REGION_BLOCKED。网关层对 google 系模型强制 Provider Pinning 至 vertex 通道,请求级失败自动切换降级链,全程对上层业务透明。
🧵
流式思考外化
大纲生成采用 SSE 全链路透传:模型被约束先输出逐行分析轨迹(▸ 前缀协议),再输出 ===OUTLINE=== 分隔符与结构化 JSON。前端按协议增量渲染,用户看到的「AI 正在思考」即模型真实输出。
🧩
容错 JSON 解析
LLM 结构化输出存在 code-fence 包裹、前后缀噪声等不确定性。解析器采用括号配对回收策略(首 { 至末 } 切片 + fence 剥离 + 字段级规范化),实测解析成功率 >99%,失败自动触发单节重试。
👩⚕️
Human-in-the-loop
医学内容零容错。AI 产物全部以「草稿」形态进入医生审校台,大纲可增删改序、正文案例逐字可编、Quiz 正确项可重标;未经医生确认的内容永远不会触达学员。
一门 8 节课(含 24 道 Quiz、约 30 个临床案例、8000+ 字正文)的端到端生成:约 40 秒·成本不足 1 元·医生审校后上架
* 本页为演示环境的技术说明,数据为该环境实测量级