Castform 是一个模型训练平台,专注于对任务专用模型做后训练、评估与上线。平台可从现有语料库、智能体 trace 等已有数据自动生成训练集,支持定义工具与奖励函数、监控训练过程,并提供 LLM 裁判、批量评测与 playground,对接 Qwen、Gemma 等开源模型,目标是以开源成本达到前沿模型水平。
Capability Timeline
训练数据清洗
对预训练/训练语料做质量过滤、噪声删除与改写清洗,输出可用于模型训练的数据集
4 个工具4 条动态
相关工具
4模型训练学习强化学习训练性能基准训练数据清洗
近7天 1 动态
Oumi 是面向企业的“AI 工厂”生产线平台,用户可像使用 Claude Code 一样通过提示词或 Web UI 构建专用模型:由 Oumi Agent 自动合成训练数据、生成可复现配方、做数据分析与清洗,并用 LLM-as-a-Judge 评估器对比基线;支持 0.8B 到 120B 开放权重模型微调与前沿模型蒸馏,一键部署 OpenAI 兼容推理端点,再针对失败模式合成新数据形成持续改进循环。
合成数据生成模型推理服务模型训练学习强化学习训练训练数据清洗
近7天 1 动态
Ultra-FineWeb-L1 是面壁智能开源的一套经精细处理的英文网页语料库,包含超 1T tokens 与约 11.4 亿文档,数据覆盖至 CC-MAIN-2025-51。作为 UltraData 生态的 L1 过滤层,它通过文本提取、语言过滤、启发式过滤及去重等流程提升数据质量,已上线 HuggingFace,可供模型预训练与语料清洗使用。
训练数据清洗
近7天 1 动态
DataOrchestra 是 GAIR-NLP 开源的预训练数据清洗框架,用轻量编排器对每个数据块单独决定 Drop、Untouch 或 Clean,并为需清洗的块选择噪声删除与改写等下游阶段并生成具体指令,由对应工具模型执行。仓库开源了编排器训练数据构建流程、运行脚本与各阶段提示词。
训练数据清洗
近7天 0 动态6 Stars

