一套全栈 AI 英语教培系统分为学员端(C端)、教师/机构端(B端)以及底层的 AI 核心服务架构。以下是深度拆解。
一、 核心功能模块
- 学员端:C端交互与学习闭环
代理式沉浸口语导师:支持雅思考官、职场面试官、日常外教等多角色切换。具备全双工(Full-Duplex)打断功能,卡顿超过 4 秒时自动弹出提示词(Hints)辅助输出。
音素级发音与跟读诊断:针对单词与长句进行发音诊断,精准定位元音/辅音错音(如 /θ/ 与 /s/),绘制语调起伏波形图与连读、重音标记。
穿透式交互阅读与听力:点击生词即时显示上下文专属释义;一键长难句语法拆解;支持将一篇新闻一键重写为符合学员当前 CEFR 等级(A1-C2)的分级文本。
智能写作深度批改:支持手写/拍照 OCR 识别输入,AI 按照高考/雅思等标准进行多维点评(拼写语法、词汇丰富度、句式多样性、逻辑连贯性),并提供一键升华润色版本。
- 教师/机构端:B端降本与教学管理
AI 助教与一键备课:教师通过 Prompt 一键生成符合课标的教案、互动课件 PPT 提纲、分层阅读材料及听力/口语测试题库。
自动化批量批改:AI 自动完成班级学生口语录音与英语作文的初审打分,生成高频语法错题集与发音缺陷报告。
全景学情大数据看板:可视化展示学生词汇量增长曲线、CEFR 等级演进、开口时长及薄弱知识点图谱,支撑数据驱动的精准辅导。
二、 技术栈选型
- 实时通信与音频流传输(RTC)
RTC 传输:声网 (Agora) / 即构 (ZEGO) / WebRTC,确保音视频数据包在全球范围内的端到端传输延迟控制在 200ms 以内。
VAD(语音活动检测):Silero VAD / WebRTC VAD,负责在本地设备端或边缘节点精准识别学员的静音、卡顿与说话断句。
- 语音识别与合成(ASR & TTS)
ASR(语音识别):Deepgram / OpenAI Whisper / 微软 Azure Speech,重点针对带有各地方言口音的非标准英语(如中式发音)进行高容错识别。
TTS(语音合成):ElevenLabs / Cartesia / Azure Neural TTS,输出超低延迟(< 100ms)、高度拟人的多情感音色。
- 大模型与应用层架构(LLM & Backend)
主控 LLM:GPT-4o / Claude 3.5 Sonnet / DeepSeek-V3,负责复杂的对话交互、写作深度批改及教学逻辑推导。
原生端到端语音大模型:OpenAI GPT-4o Realtime API / Gemini Multimodal Live API(直接跳过中间 ASR+TTS 拼装过程,降低延迟)。
向量数据库与知识库(RAG):Milvus / Pinecone,存储挂载 CEFR 词库、教材知识点、语法规则库及机构自有教研资产。
工程开发:前端采用 Flutter / React Native 进行跨端开发;后端采用 Python (FastAPI) / Node.js + WebSocket 维持高并发长连接。
三、 关键技术难点与解决方案
- 全链路超低交互延迟
难点:传统的 VAD断句 -> ASR转文字 -> LLM推理 -> TTS合成 -> 客户端播放 串行逻辑易产生 2-3 秒顿挫感。
解法:构建全链路流式管道。ASR 边听边吐字(Streaming ASR),LLM 边出字边通过 WebSocket 分块喂给流式 TTS 引擎;或直接基于 WebSocket 接入原生多模态实时语音 API(Realtime API),实现音频“首包即播”。
- 教学 Agent 的“主导权与状态机”控制
难点:大模型容易陷入“过于罗嗦”或“被学生带偏话题”的情况,无法完成既定的教学目标。
解法:采用双 Agent 解耦与有限状态机(FSM)架构:对话主 Agent:在 System Prompt 中强制约束单次回复限制在 1-2 句话内,且必须以“开放式提问/引导”结尾。评估 Worker Agent:异步后台运行,专门负责提取学生输入中的语法错误和发音缺陷,写入后台数据库,不阻塞前台对话流。状态机导航:按课程 Lesson Plan 强制流转,当发现偏离主题时由状态机强制重置 Prompt 上下文。
- 音素级发音诊断的准确度
难点:通用 ASR 往往会“自动纠错”(即学员发音错误但 ASR 识别出了正确的词),导致无法精确指出错音。
解法:采用专门的发音评估引擎(如基于 GOP 算法或声学模型音素比对),提取音频的基频、振幅与音素概率矩阵,在音素级别进行得分比对,而非依赖通用大模型的文本识别。