基于 HuggingFace Tokenizers 训练自定义分词器
本文详解如何基于Hugging Face Tokenizers库,从零训练一套适配Qwen3设计的高性能BPE分词器:涵盖语料构建(开源数据+模型蒸馏)、清洗、BPE训练、多模态/工具/思考等特殊Token注入,以及全维度测试验证(编解码一致性、Chat Template渲染、边界场景等),为自研大模型打造高质量词典基座。
AI 已经会写论文了,Textira 为什么还要重做一遍科研工作流?
AI 已经能写摘要、改论文、生成 LaTeX,但真正完成一篇论文,研究者仍要在实验数据、参考文献、写作工具和投稿要求之间反复切换。Textira 想解决的不是“让 AI 更会写”,而是让 AI 真正进入科研工作流:理解已有论文、实验结果和目标期刊,在不破坏事实、引用和结构的前提下继续修改和完成论文。当生成文字已经不再稀缺,科研 AI 的下一场竞争,或许才刚刚开始。
用 Java 接入大模型(一):把流式输出跑通
本文是「用 Java 接入大模型」系列首篇,聚焦最易卡壳的流式输出:详解 SSE 协议原理、手写 60 行无依赖流式客户端(兼容通义千问/OpenAI),并揭示新手必踩的三大坑——不按行解析、漏传 `stream:true`、忽略空 content。代码即学即用,拒绝玄学,只讲真实可跑的 Java 实现。
手机三要素详版核验技术解析:接入流程、参数设计与风控实践
本文面向实名一致性核验场景,梳理手机三要素详版核验接口的技术实现。该接口传入姓名、身份证号、手机号三项信息,返回三者是否一致的核验结果,并在不通过时给出细分原因代码(code 值域)与可选归属地扩展信息。全文覆盖:能力要素对比与选型思路、接入与鉴权流程(APPCODE 简单鉴权 / 签名鉴权)、完整请求参数与成功/失败返回结构、四语言调用片段、在线调试实录、频控与幂等等工程最佳实践、网关级与业务级错误码排查、技术 FAQ。适合在金融开户交易、电商生活服务、出行信贷、政务合规等企业实名核验节点做一致性判定的开发者与工程人员参考。