M1
数据与训练管线
进行中构建中文语料清洗流程,跑通从数据到模型权重的完整训练管线。
- 语料清洗脚本
- 训练管线跑通
- 小规模基线模型
AI LAB
nAI 是 new AI 的缩写,也是我们正在做的事:不依赖现成大模型套壳,从数据、训练到评测完整走一遍,先追平 ChatGPT 3.5 当年的多轮对话与基础推理水平。更远的目标是探索实现 AI 的新路径——方向待定,但过程会全部公开。
DIRECTIONS
四个方向,先做扎实的,再做花哨的。
从语料清洗到训练与微调,把整条管线自己搭一遍,而不是只调用别人的接口。
多轮对话的连贯性与指令遵循,目标是追平 ChatGPT 3.5 的日常使用体验。
短链逻辑、数学与代码理解,建立可复现的评测集,用数据说话。
长期目标:寻找不同于当前主流范式的实现路径。方向待定,先做出基础能力再谈突破。
MODEL ROADMAP
分阶段推进,每一阶段都要留下可复现的产物。
构建中文语料清洗流程,跑通从数据到模型权重的完整训练管线。
完成指令微调,具备稳定的多轮对话能力,对标 ChatGPT 3.5 的对话水准。
在数学、逻辑与代码理解上具备短链推理能力,并建立可复现的评测标准。
长期目标:探索实现 AI 技术的新途径。方向待定,取决于前三阶段的实验结论。
EXPERIMENTS
确定第一阶段目标——追平 ChatGPT 3.5 的多轮对话与基础推理,并划清「不套壳」的边界。
跑通从原始语料到可训练数据集的流程,产出第一版清洗脚本与数据统计。