little-lm
配置驱动的小型解码器 LLM 训练框架
little-lm 是工程师 Hugo Vergnes 自研的配置驱动小型解码器 LLM 训练框架,每次运行通过一个 YAML 文件完整定义模型、数据集、优化器、调度与回调,组件自注册并按名称解析,替换优化器或数据集只需改一行配置。作者用该框架在租用的 8× B200 上以约 998 美元、43 小时、65B tokens 从零训练出 3.848B 参数的 Llama 风格模型,CORE 得分 0.384,高于 nanochat d32 的 0.310
1
2026-09-10
未收录
—
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
little-lm 是工程师 Hugo Vergnes 自研的配置驱动小型解码器 LLM 训练框架,每次运行通过一个 YAML 文件完整定义模型、数据集、优化器、调度与回调,组件自注册并按名称解析,替换优化器或数据集只需改一行配置。作者用该框架在租用的 8× B200 上以约 998 美元、43 小时、65B tokens 从零训练出 3.848B 参数的 Llama 风格模型,CORE 得分 0.384,高于 nanochat d32 的 0.310
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-09-10
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-09-10版本发布
作者用自研配置驱动框架 little-lm,在 8× B200 上以约 998 美元、43 小时、65B tokens 从零训练出 3.848B 参数 Llama 风格模型(2048 上下文),CORE 得分 0.384,高于 GPT-2 1.5B 的 0.2565 和 nanochat d32 的 0.310,并公开完整训练复盘。
little-lm 常见问题
关于 little-lm 的定位、核心功能、价格与最近更新。
little-lm 是什么?
little-lm 是工程师 Hugo Vergnes 自研的配置驱动小型解码器 LLM 训练框架,每次运行通过一个 YAML 文件完整定义模型、数据集、优化器、调度与回调,组件自注册并按名称解析,替换优化器或数据集只需改一行配置。作者用该框架在租用的 8× B200 上以约 998 美元、43 小时、65B tokens 从零训练出 3.848B 参数的 Llama 风格模型,CORE 得分 0.384,高于 nanochat d32 的 0.310。
little-lm 有哪些核心功能?
little-lm 当前已核验的核心功能包括:模型训练学习。
little-lm 如何收费?
AI Equal 当前没有收录 little-lm 的可验证价格信息。
little-lm 最近有什么更新?
2026-09-10:作者用自研配置驱动框架 little-lm,在 8× B200 上以约 998 美元、43 小时、65B tokens 从零训练出 3.848B 参数 Llama 风格模型(2048 上下文),CORE 得分 0.384,高于 GPT-2 1.5B 的 0.2565 和 nanochat d32 的 0.310,并公开完整训练复盘。