Add new attachment

In order to upload a new attachment to this page, please use the following box to find the file, then click on “Upload”.

List of attachments

Kind Attachment Name Size Version Date Modified Author Change note
pdf
1808.00508v1.pdf 1,668.9 kB 1 09-Feb-2026 12:19 14.153.69.91
png
分布式增量训练流程图_01.png 162.4 kB 2 08-Jun-2026 19:50 14.155.111.131
png
分布式增量训练流程图_01中文版.png 1,330.3 kB 1 10-Jun-2026 14:08 14.153.67.109
png
分布式增量训练流程图_01英文版.png 1,496.7 kB 1 10-Jun-2026 14:08 14.153.67.109
png
分布式增量训练流程图_中文.png 887.0 kB 1 02-Jul-2026 15:21 14.153.63.230
png
分布式增量训练流程图_中文缩放.png 185.8 kB 1 02-Jul-2026 15:32 14.153.63.230
png
分布式增量训练流程图_英文.png 1,043.3 kB 1 02-Jul-2026 15:20 14.153.63.230
png
分布式增量训练流程图_英文缩放.png 197.8 kB 1 02-Jul-2026 15:33 14.153.63.230
png
分布式训练流程图_01.png 169.9 kB 1 10-Jun-2026 14:20 14.153.67.109
png
分布式训练流程图v2_英文版(1).png 1,914.2 kB 1 27-Aug-2026 10:26 134.195.101.87
png
推理中训练流程图_01(缩放).png 178.1 kB 1 27-Aug-2026 10:25 134.195.101.87
png
推理中训练流程图_01.png 1,545.4 kB 2 27-Aug-2026 10:22 134.195.101.87
pdf
监控工具业务流程1.0.pdf 3,111.1 kB 1 06-Feb-2026 16:40 14.220.175.62
pdf
神经元算术运算核心公式解析.pdf 561.6 kB 1 06-Feb-2026 16:42 14.220.175.62

This page (revision-35) was last changed on 27-Aug-2026 10:28 by 134.195.101.87

This page was created on 08-Dec-2025 10:32 by 14.155.111.29

Only authorized users are allowed to rename pages.

Only authorized users are allowed to delete pages.

Difference between version and

At line 1 changed 2 lines
亚当计划是立足最少资源,一步一步扩大扩大模型规模的增量训练计划\\
[|http://www.mandelbrot.cn:8080/JSPWiki/attach/Adam%20plan/%E5%88%86%E5%B8%83%E5%BC%8F%E5%A2%9E%E9%87%8F%E8%AE%AD%E7%BB%83%E6%B5%81%E7%A8%8B%E5%9B%BE_01.png]
亚当计划是立足最少资源,一步一步扩大扩大模型规模的分布式增量训练计划\\
[|http://www.mandelbrot.cn:8080/JSPWiki/attach/Adam%20plan/%E5%88%86%E5%B8%83%E5%BC%8F%E5%A2%9E%E9%87%8F%E8%AE%AD%E7%BB%83%E6%B5%81%E7%A8%8B%E5%9B%BE_%E4%B8%AD%E6%96%87%E7%BC%A9%E6%94%BE.png]
At line 4 added 6 lines
推理中训练架构图
[|http://www.mandelbrot.cn:8080/JSPWiki/attach/Adam%20plan/%E6%8E%A8%E7%90%86%E4%B8%AD%E8%AE%AD%E7%BB%83%E6%B5%81%E7%A8%8B%E5%9B%BE_01%28%E7%BC%A9%E6%94%BE%29.png]
!我们解决的核心问题是,黑箱大模型需要整个模型全量参数以高传输速率到各个GPU才能完成预训练的通信瓶颈问题,而我们的白盒模型的模块之间是低数据传输,绕开了这个硬件瓶颈。(100Mbps与100Gbps的区别)
!!!最关键超大模型的预训练,不会因为通信延迟或者波动而崩溃
At line 5 changed 2 lines
1> 5月底完成7B模型训练\\
2> 7月份前要引入大资金\\
1> 8月底完成7B模型训练\\
2> 9月份前要引入大资金\\
At line 17 changed one line
这个计划将彻底改变大模型的训练范式
这个计划将彻底改变大模型的预训练范式
!随着我们的增量预训练方案落地,我们已经彻底超越deepseek的最低预训练成本
Version Date Modified Size Author Changes ... Change note
35 27-Aug-2026 10:28 1.088 kB 134.195.101.87 to previous
34 27-Aug-2026 10:26 1.088 kB 134.195.101.87 to previous | to last
33 27-Aug-2026 10:23 1.064 kB 134.195.101.87 to previous | to last
32 27-Aug-2026 10:21 0.913 kB 134.195.101.87 to previous | to last
31 02-Jul-2026 15:33 0.91 kB 14.153.63.230 to previous | to last
30 02-Jul-2026 15:21 0.892 kB 14.153.63.230 to previous | to last
29 22-Jun-2026 16:32 0.858 kB 14.153.71.132 to previous | to last
28 22-Jun-2026 16:32 0.854 kB 14.153.71.132 to previous | to last
27 22-Jun-2026 16:31 0.852 kB 14.153.71.132 to previous | to last
26 10-Jun-2026 19:22 0.824 kB 14.153.67.109 to previous | to last
25 10-Jun-2026 17:13 0.804 kB 14.153.67.109 to previous | to last
24 10-Jun-2026 17:13 0.787 kB 14.153.67.109 to previous | to last
23 10-Jun-2026 14:21 0.757 kB 14.153.67.109 to previous | to last
22 10-Jun-2026 14:10 0.775 kB 14.153.67.109 to previous | to last
21 10-Jun-2026 14:08 0.802 kB 14.153.67.109 to previous | to last
« This page (revision-35) was last changed on 27-Aug-2026 10:28 by 134.195.101.87