集成同源 BYOK 会话隔离、精简模型设置、官方订阅入口和 HTTPS 发布运维;保留本地训练/调参与控制能力。同步 npm 版本及 CHANGELOG,记录公网真实 API 验收仍待用户凭据。
29 KiB
更新日志
本项目的重要变更记录在此文件中,版本标签使用 v主版本.次版本.修订版本 格式(历史标签使用大写 V)。
[未发布]
[1.0.1] - 2026-09-24
CADWorld 网站发布与 LeKiwi 智能抓放集成
-
将当前网站及其依赖的 LeKiwi/移动操作源码归档为
v1.0.1,同步 npm 包与锁文件版本;不包含密钥、个人模型、构建产物或测试日志。611 项前端单元测试、39 项决策服务测试和公网浏览器 3/3 已通过;公网真实付费 API 验收仍等待用户自带密钥,不将本地既有真实调用或公网 mock 验收等同于本次云端真实 API 验收。 -
CADWorld 网站已部署至
https://cadworld-sim.robotquan.com,版本20260923T130923Z-web;验证 HTTPS 签发/续期 dry-run、内部端口隔离、前后端成对回滚与后台异常自动重启。公网浏览器 3/3 通过,真实 WASM mock 抓放搬运 0.5937274 m;订阅入口实测明确返回codex_rpc_failed并清理,未登录/推理。真实 API 调用等待用户自带密钥,详见docs/website-release-2026-09-23.md。 -
新增 CADWorld website 构建与同源公开 BYOK 网关:匿名安全 Cookie/CSRF、逐会话密钥/配置/任务/取消/预算隔离、TTL 清理、IP/全局并发限制,保留本机 Bearer 模式;公网仅允许固定 DeepSeek/OpenRouter 上游,不接受任意 URL。
-
网站模型设置精简为 LLM API_KEY/模型选择与独立 Jev OpenRouter API_KEY,原子保存不推理;保留固定 Codex 0.147.0 官方设备码订阅登录,账号进程隔离、失败不切换付费 API。训练/调参/外控仅在 website 模式隐藏,原本地功能不删除。
-
增加生产构建下的真实后端/假 HTTP 上游、双浏览器会话隔离与真实 WASM mock 抓放验收;增加锁版本离线镜像、最小权限 Compose、1Panel/OpenResty HTTPS、证书自动续期与成对发布/回滚配置。真实云端 API 和订阅推理需要用户另行提供凭据/交互,不冒充已验收。
-
高面数二进制 STL 通过保留全部顶点精度/绕序/三角形的 OBJ 兼容层导入,保留原始资产哈希,支持派生资源缓存、取消、预算与完整工程 ZIP 导出。A /
lekiwi-v1三个轮各恢复 314,244 面 CAD 视觉,碰撞配方/惯性不变;旧缺轮 MJCF 需重转。 -
增加真实 WASM 完整轮、ZIP 重导、重复释放、原生训练快照与性能验收。软件 WebGL 高面数外控视口降为低频刷新以保留原 500 ms 安全看门狗,不减面、不修改物理时钟;性能与失败边界见
docs/lekiwi-mesh-compatibility.md。 -
增加 A 单方块双支撑台的确定性抓放基线、scratch-data 五轴阻尼 IK 和独立接触/运输/放置评估。5 个冻结 ±2 mm 小扰动种子真实 WASM 5/5 通过,持物平移约 0.594 m;不代表任意场景泛化、RL 收敛或模型闭环。
-
新增版本化智能任务契约、取消/超时/迟到响应隔离及
agent独占控制票据。只有当前物理回调可写执行器,等待模型不补积压物理步;agent 所有者下同一基线通过。 -
新增独立回环
decision_server/:共享契约 Python 校验、内存密钥、Host/Origin/token 防护、取消/预算、OpenAI Responses/兼容 Chat 与 TypeSafe/OpenRouter Jev 专用协议,无静默降级。按用户授权显式读取.env两项变量;OpenRouter Jev 与 DeepSeekdeepseek-flash的合成状态真实单请求通过,不代表物理闭环已完成。 -
增加 LLM—Jev—本地技能的异步邮箱调度、逐技能物理门禁、任务暂停/单技能步进和有界恢复/重规划;真实 API 不降级 mock,模型等待不推进物理,安全故障立即停止。mock 决策 + 真实 WASM 闭环 5/5 通过,旧基线 6 项也通过;每回合 1 次规划/11 次判定、持物搬运约 0.594 m。步骤 8 时 Vitest 599 项通过;后续真实双 API 回合见下文,订阅回合仍需用户登录。
-
新增固定 Codex 0.147.0 官方 stdio 登录/状态/模型/结构化规划/中断,仓库外独立 HOME 与仅会话认证,匹配版本的无工具目录及每模型离线工具注入门禁。5 个当前可见模型门禁和真实 stdio 假推理通过;真实订阅登录/推理仍待用户交互验收。新增独立无云凭据 CI、服务/原生门禁测试及第三方许可。
-
主工作台新增 LeKiwi 智能抓放、模型连接/官方订阅管理、任务暂停/单技能步进、受限目标编辑与证据导出;A 文件导入→mock 完整物理成功→导出/重置的真实主视口用例通过。软件渲染仅为 agent 降低完整 CAD 绘制频率,仍复用唯一 advance。地图草稿与后台训练保留,切回 RL 重建其原场景。独立页 HTML、两个启动组件及 Vite 入口已移除,构建仅保留主工作台和 tuning;两模型物理/ONNX 夹具保留。步骤 9 时前端 605 项测试通过。
-
用户确认以已通过的 DeepSeek + Jev 真实闭环完成最终验收,计划标记 10/10。ChatGPT 隔离官方登录已确认,但订阅推理用例在模型调用前因 UI 选择器未匹配中止;补充下拉框可访问名称及显式 opt-in 用例。用户随后要求结束验收,未再运行订阅推理,LLM/Jev 请求均为 0,临时会话已关闭;不将登录成功称为订阅抓放成功。
-
最终验收新增真实双 API 主视口用例(显式 opt-in、最多 1 次 LLM/12 次 Jev),DeepSeek
deepseek-flash+ OpenRouter Jev 两轮均成功:每轮 1 次规划/11 次判定、47.220 s 仿真、0.593727 m 有效搬运、7.689 mm 放置误差。修复浏览器原生 fetch receiver,未保存的配置草稿阻止沿用旧付费连接;不把未报告费用记为零。ChatGPT 订阅仍待用户交互登录,不宣称已通过。 -
补充真实 WASM 持续空抓/一次空抓后成功恢复/对齐失败/滑落/锁肩/超速/导航超时/真实 IK 不可达及两目标角点,10/10 通过。增加臂卡住实测保护,恢复目标从实测位置初始化;5 个生命周期迟到响应不写入/不步进,8 次模型与 IK 循环共 48 个原生句柄确认释放,heap 后 6 次稳定在 1567.75 MiB。
-
最终 Vitest 129 文件/608 项、typecheck、TS/Python lint、build 通过;模型服务 28 项含单独启用的原生离线门禁通过。旧工作台/地图/调参 92 通过、6 可选跳过;LeKiwi 20/20、两模型物理/ORT 2/2;agent→RL 场景隔离、一键训练/策略导入与继续训练通过。LeRobot 60 s/1800 动作、RTT P95 27.593 ms、零超时/丢请求。全仓格式检查仅余四个既有文件,不覆盖原有工作;详见
docs/lekiwi-agent.md。 -
移动操作升级
mobile-manipulator-v2:92 维观测包含上次动作与积分目标,臂目标限速 0.5 rad/s、物理子步实际速度保护;废除全行程位置跳变,拒绝旧68维策略。Bundle 修复关节级 ±1 N·m 限力覆盖舵机限力造成的姿态下垂/碰撞,Go2 不变。 -
参考 IsaacLab Franka reach 的动作缩放、动作变化率/关节速度惩罚与课程结构,新增底盘接近→末端接近→抓取放置阶段。支持可关闭的导航示教初始化、保守 PPO 微调、种子随机化、服务内 checkpoint 接续和独立评估;未达到至少10回合/80%成功率/零安全终止,禁止进入下一阶段。新增共享控制 golden、参数/接续门槛与真实 CPU/ONNX 回归。
-
更新
docs/mobile-training-curriculum.md记录实测导航结果和限制;不把短程导出视为抓取收敛,不修改或启动外部 IsaacLab 环境。 -
LeKiwi v1/Bundle 训练统一至主工作台「控制台 → 强化学习任务」:自动同步场景、启动后台 SB3 PPO、轮询日志/Loss/奖励、停止任务、自动导出 ONNX 与部署元数据并一键导入当前仿真。移除独立实验页训练包下载入口,新增变体选择与任务专属超参,保留 Go2 流程。
-
增加认证有界场景快照 API、机器人/路径/资产校验、按任务依赖就绪检查及
--mobile-python隔离解释器;避免 MuJoCo 3.11 移动任务升级现有 Go2 环境。主会话推断校验权重/配置/场景 SHA-256、固定68→12张量,控制权切换/暂停/重载使迟到结果失效。 -
补充前后端任务创建、参数、日志、取消、成果物与策略生命周期回归;两种真实模型完成主控制台短程 PPO→ONNX→浏览器推断端到端冒烟。短训练验证链路,不代表抓取收敛、实机部署或跨形态泛化。
-
新增
/mobile.html移动操作 RL 实验页和三层模块:复用 ZIP/MEMFS/查看器,分别适配原始 LeKiwi 与本次实测的 Link1–Link4 bundle;固定 68 维观测、12 维动作、阶段奖励/成功判据和 50 Hz 控制,支持位置/速度伺服、遥操/ONNX 切换、鼠标拖动物体与目标、奖励和性能显示。 -
新增浏览器训练场景导出、对称 Python Gymnasium 环境、可选 PPO 入口及 PyTorch→ONNX 导出/ORT 数值校验;跨语言 golden、真实 WASM/原生 MuJoCo 短轨迹、鼠标拖动、候选回滚和 ONNX 过期结果回归。没有预训练抓取策略、实机标定或跨形态泛化承诺。
-
移动操作管理器采用单步进所有者、串行事务与双槽 VFS,避免不断变化的资源路径扩张原生网格缓存;先释放查看器资源再删除旧 model/data,回滚时刷新因共享 WASM heap 增长失效的 views。新增
docs/mobile-manipulator.md的接口、资源/碰撞近似与性能验证边界说明。 -
LeKiwi profile 新增保守的 URDF 语义等价校验:允许显示名、换色、XML 重排及等价数值/RPY,不再只凭文件哈希拒绝非机械变体;保留完整运动链/物理属性检查,并校验全部 45 个源网格。结构变化报告具体缺失/新增关节与属性,新增实际输入 SHA-256 溯源及真实 WASM 控制/导出重载回归。
-
通用导入修复重新打包的 ROS URI 和
meshes/package://错误前缀,保留工程内相对路径并拒绝歧义;profile 预检查失败不再创建未释放的临时 MEMFS 工作区。 -
新增
docs/lekiwi-urdf-compatibility.md:记录New_urdf两份 ZIP 的实际结构、来源哈希和控制适配边界。两包由旧五臂轴加夹爪变为七个新活动轴,不能复用旧九路控制/碰撞;修复资源引用后仍受 314,244 面轮 STL 超过 MuJoCo 200,000 面上限约束,不宣称已完成新机构仿真或 LeRobot 适配。
[0.10.1] - 2026-09-20
初步集成 LeKiwi,优化碰撞模型
-
LeKiwi 碰撞配方升级到 revision 4:新增隔离环境的离线 CoACD 全臂“从视觉生成碰撞体”管线,校验固定 URDF/STL 来源、版本/参数缓存和配方指纹;18 个视觉网格(含焊接附件)的 538 个分解凸包经配合区分割得到 1,220 个零附加质量碰撞体,替代旧胶囊和 revision 2/3 手工分段。旧 MJCF 必须从原始 URDF 重新转换,参考仓库及训练/LeRobot 环境不改。
-
移除整对相邻连杆排除,以关节局部装配几何分割、有限配合例外和保守整周包络筛选启用 5,581 对结构接触;修复 Mirror/Square 穿入,避免跨轴承区域凸包误锁肩旋。采用 1 ms 物理步长,保持协议、关节范围、单写入者与 500 ms 看门狗;新增 108 次原 CAD 覆盖探针、六关节双向扫掠、实际接触/反向脱离和性能回归。完整几何有额外开销,不承诺任意穿透初态、高速运动或硬实时;已知引擎诊断限制见碰撞数据说明。
-
机器人 profile 的关节角改为只读,底层拒绝直接 qpos 位姿写入、单独重置关节及忽略限位,禁用关节拖动入口,避免网页姿态编辑绕过物理;手动执行器目标及统一外控仍通过物理积分运动,普通模型的姿态编辑不变。夹爪间隙验收增加独立三角面距离 oracle,不依赖异常零距离查询或放宽断言。
-
修正夹爪开度方向与闭合限位,补齐指尖/指面接触并支持碰撞几何显示;保留早期 revision 2/3 手工分段的历史重建工具,当前运行时统一使用 revision 4,旧 MJCF 必须从原始 URDF 重新转换。
-
LeKiwi 终端遥操作新增五个臂关节与夹爪正反点动、可配置速度和空格停止点动;同一30Hz循环合成底盘/臂动作,从实测初始姿态与限幅确认目标累加,保留超时撤权;补充按键表、leader接入边界、单测和真实PTY/浏览器物理回归。
-
修复 LeKiwi/通用桥接将暂停超过500ms误报为观测过期:优先提示播放并重新授权,底层禁止暂停时授权且不切换控制权;保留运行中的500ms安全看门狗,补充回归与键盘演示排障说明。
-
新增通用机器人 V1 契约、共享 TS/Python fixtures、模型地址绑定与单写入者仲裁;保留现有 Python、Go2 ONNX 和训练接口。
-
新增显式 LeKiwi v1:可重建固定来源资产、简化被动滚子/碰撞与九路伺服,真实 WASM 验证全向运动、臂/夹爪和障碍阻挡;不是实机标定。
-
新增独立回环控制桥、通用同步 Python SDK 和实际 LeRobot 0.6.1 插件;CPU 依赖隔离在 build/venvs/lerobot,不改训练环境或上游源码。
-
控制台集成 profile 校验、连接/token、明确授权、状态/新鲜度与安全停止;控制凭据仅在页面内存。覆盖 lease/epoch、确认目标与实测状态区分、重载/回滚、过期消息、隐藏/冻结和旧控制回调隔离。
-
外控使用独立固定步长调度,软件渲染时关闭阴影并限制3D绘制为5FPS,为30Hz通信保留主线程时间;非硬实时、非锁步。修复跨 reset 的观测序号判断及冻结后迟到动作续租问题。
-
增加普通桥接 CI 与独立固定 CPU LeKiwi 兼容任务、完整工作台60秒真实控制证据、部署/安全/能力矩阵和许可证记录;相机、LeRobot 数据集和实际 RL 训练仍不支持。
[0.9.5] - 2026-09-09
-
修复外力拖动箭头起点停留在初始位置:保存拾取点的 body 局部坐标,每帧随部件平移和旋转更新,即使鼠标静止也持续跟随;保持现有外力方向/大小控制,补充位姿跟随与释放清理测试。
-
小坐标轴拖动增加与主视口相同参数的阻尼惯性,松手后逐帧减速且保持总旋转幅度;新操作、手势取消及资源清理可终止惯性,补充衰减与中断测试。
-
坐标轴拖动灵敏度对齐主视口高度与旋转速度;点击轴向采用约 300ms 平滑过渡,支持鼠标操作中断,补充幅度与过渡回归测试。
-
修复右下角 XYZ 方向指示器无法交互:支持左键拖动旋转视角、点击轴字母切换对应正轴视图及点击负轴端点切换反向视图;保持观察中心与距离,隔离场景点击,处理拖动取消与资源清理,并补充交互回归测试。
[0.9.4] - 2026-09-09
- 前端设计优化:升级蓝黑、电光青与少量紫色的 Cyber HUD 视觉,保留亮色主题;统一工作台、欢迎界面、共享控件、浮层和源码/调参窗口材质。
- 恢复自调参平台左侧会话与 Trial、中间指标与排行、右侧决策与审批的三栏布局;窄屏纵向排列,保留审批与 Monaco Diff 操作。
- 增加运行状态呼吸与交互微光,支持减少动态效果、强制色彩和无模糊能力回退;侧栏采用静态材质,避免大面积实时模糊影响仿真性能。
- 优化欢迎页与源代码入口、执行器控件密度和重复参数提示,将训练地图操作文案统一为“同步场景地图”。
- 补充双主题材质、状态动效、回退及三栏布局回归测试和设计交付说明;性能数据仅为无头 Chromium 短时特效开关对照,不代表真实 GPU 或重型模型基准。
[0.9.3] - 2026-09-08
- 重构绿色主工作台:紧凑全局入口、可收起资源/上下文侧栏,统一状态、仿真/地图工具、草稿、摄像头与风险槽位;窄屏临时布局不覆盖桌面偏好。
- 逐模块整理地图、Body/Joint/Actuator、Python/ONNX、训练与录制的信息层级,保留单位、主动作、兼容限制及危险后果;控制台首次懒挂载后保留输入与任务状态。
- 独立调参改为指标/排行主区和会话/决策侧展,保留审批、Monaco 差异、参数护栏及停止入口;主工作台/调参共享深浅主题,换主题不丢图表缩放或编辑草稿。
- 统一 Tooltip/Popover/对话框边界、全屏 Portal 与顶层 Escape;修复 Dialog 焦点恢复、Monaco 模型释放顺序、摄像头实际渲染槽位,以及浅色主按钮对比色被共享 CSS 覆盖的问题。
- 补深浅主题五档布局、领域/调参/系统截图和交互回归,同步设计文档及旧 E2E 入口。训练/调参布局采用 mock;真实训练、Agent、外部真实策略/上传服务和长期性能不作为本次 UI 验收通过项。
[0.9.2] - 2026-09-08
- 修复custom_boxes因起终点编辑使同步状态持续失效而无法训练:移除训练面板起终点坐标显示与编辑,训练/调参启动时自动重新编译已应用碰撞场景,并自动选择满足净空、最小距离和连通性约束的参考点。
[0.9.1] - 2026-09-08
-
Go2避障训练改为每个episode从同一连通自由区域随机采样起终点并随机化初始朝向,保证障碍/边界净空和最小目标距离;固定三seed评估及浏览器部署仍使用声明的参考起终点,兼顾泛化与可比性。
-
修正基础策略上传存储错误分类:文件打开/写入/关闭失败返回503并提示检查磁盘空间/权限;流读取超时或连接截断仍返回400,均保留临时清理与socket超时复位。
-
完成普通训练与自调参共用单文件.pt/.onnx上传入口:默认服务直接连接、Go2 legacy47模板确认、自动选择内容ID/文件SHA、取消及同文件重试;任务/连接epoch变化保留旧选择并隔离晚到响应,上传中禁止启动。补双面板真实HTTP浏览器验收与4环境×1iteration CPU ONNX-derived PPO/导出/统计恢复检查(仅链路验证)。
-
新增Go2 legacy47单文件.pt/受限MLP ONNX上传后端,无需管理员注册/邻接配置;认证有界二进制接收、CPU限额安全校验、持久化内容SHA来源,复用普通训练/自调参warm-start与rung自身resume。ONNX只继承确定性网络,明确模板假设、合成normalizer count及fresh训练状态;双UI文件选择待接入。
-
修复跨任务奖励preset混入Flat:以持久化来源session恢复权威taskId,读写与训练入口完整验证任务schema;跨任务或损坏来源在创建作业前拒绝,Flat菜单仅展示已确认Flat的preset。
-
修复导航设定拖回起点误触:超过5px后持续记为拖动,取消/Esc/清理/卸载清空整个手势,下一次正常点击不受影响。
-
新增显式multi_ring_raycast三层48射线/97维部署,旧缺省32射线/81维不变;task/ONNX严格模式、pitch/yaw角度及顺序白名单,浏览器观测、真实ORT shape、导航面板/PiP动态线数贯通。
-
multi奖励仅按已验证标准底板顶面几何分类过滤地面,观测保留实际地板距离;缓存静态box/方向并优化解析slab,补真实CPU/WASM/GPU短smoke及48ray整帧基准。仍存在层间/侧后/坑盲区,未实现局部高程图。
-
修复训练CLI未导入仓库任务注册模块导致直接启动Flat/Rough/Obstacle失败;保留独立解释器三seed评估与调参导航速度。事务导入失败面板改为保留完整diagnostic detail,不再用“模型编译失败”摘要掩盖ORT shape/初始化错误。
-
新增已应用场景静态碰撞多实例→权威custom_boxes导出,保留世界坐标并诚实标记AABB/标准底板近似;前后端严格校验布局、摩擦、数量及起终点圆形安全区,贯通任务JSON/ONNX与最小坐标配置。
-
新增 Go2 避障目标贴地呼吸信标、一次性点击设定目标模式、实时目标坐标/距离和目标复位;保持81维观测与异步held-action,输入与地图操纵器互斥。
-
本地训练卡片新增可折叠Loss/Reward趋势,按迭代去重补全并有界保留500点;复用共享Canvas图表,综合指标独立缩放,曲线平滑但保留原值。
-
新增 Go2 前视32射线避障训练任务、自定义地形参数、配套碰撞地图与81维ONNX浏览器部署闭环,支持PiP和射线显示。
-
自定义地图与策略采用候选会话事务,真实ONNX初始化/graph校验或地图绑定失败时保留原场景、策略和物理状态;默认Flat兼容旧无metadata的47维导出。
-
对齐原Go2训练模型的关节armature、足端接触参数和自碰撞mask,补充真实WASM/CPU射线、动力学参数及浏览器回归测试。短训练仅验证链路,不代表避障收敛。
[0.8.3] - 2026-09-04
新增
- 增加视口浮动地图工具栏(
MapViewportTools),在视口上方提供变换模式切换、坐标空间切换和快捷对齐工具。 - 增加三维场景大纲树(
SceneOutliner),直观查看场景中机器人、地图实例及层级结构。 - 增加视口快捷键挂载(
useMapEditorShortcuts),支持快速切换操纵器模式、聚焦对象和撤销操作。 - 增加属性检查器面板(
MapObjectInspector与RobotInspector),支持精确调节地图对象位姿与机器人关节/执行器。 - 增加右侧栏自适应 Tab 与多工具工作区容器(
RightSidebarTabs、WorkspaceToolsPanel)。 - 增加拖拽式连续数值调节输入组件(
ScrubbableNumberInput)与通用垂直双栏拆分面板(VerticalSplitPane)。
变更
- 重构并收敛模型控制侧栏(
ModelControlsSidebar)与工程侧栏(ProjectSidebar),移除冗余的行内变换逻辑。 - 优化地图编辑面板(
MapEditorPanel)与物理地图面板(PhysicalMapPanel),与统一检查器架构对齐。 - 清理已落地的历史设计草案与计划文档。
[0.8.2] - 2026-09-03
新增
- 将自调参工作台重构为高内聚的组件群:Session 列表导航轨(
TuningSessionRail)、控制工具栏(TuningControlToolbar)、Agent 决策时间线(AgentDecisionTimeline)、指标对比看板(MetricsComparisonBoard)、排行榜(TuningLeaderboard)、日志控制台(TuningConsole)与参数差异对比器(RewardConfigDiffEditor)。 - 建立自调参集中式状态管理(
tuningStore.ts)与自适应轮询逻辑(useTuningPolling.ts)。 - 引入标量环形缓冲区(
ScalarRingBuffer.ts),优化长周期 TensorBoard 曲线的高频更新与渲染性能。 - 服务端增加单步执行令牌(Step Token)调度,支持逐轮审批模式下的受控单步推进。
- 服务端增加参数约束 CAS 校验护栏与会话级别约束同步。
- 支持同会话内安全 Trial 的一键回滚与基准重设(Rollback)。
[0.8.1] - 2026-09-03
新增
- 统一地图资产库与多实例堆叠系统(
MapAssetLibrary、MapStackComposer),支持同源地图资产多次放置与独立位姿变换。 - 新增参数化地图实时预览图层(
ParametricMapPreviewLayer),在视口中实时预览程序化地形与碰撞体变换。 - 新增程序地形贴合与落位计算(
sceneSurface.ts),支持认证资产在程序化地形上自动重力落位。 - 引入地图场景草稿事务化编译(
mapSceneDraft、EditableMapDraftCommit),保障物理、视觉与出生点数据同步更新。 - 增强地图对象拾取与选择机制(
compiledMapPick),支持点击穿透、空白取消与实时变换操纵。
[0.8.0] - 2026-09-02
新增
- 增加基于 DeepSeek Agent 的强化学习奖励函数自调参系统(
training_server/tuning/),结合训练曲线与固定评估指标提出受限参数 patch。 - 支持全自动(Automatic)与逐轮审批(Approval)双调度模式,集成多阶段晋级(Successive-Halving)资源淘汰机制。
- 新增固定多场景评估逻辑(
evaluate.py),通过固定 seed 和组合运动指令产出与奖励权重无关的客观综合评分。 - 新增 SQLite/WAL 存储管理,持久化保留调参会话、Trial 状态、参数护栏、审计记录与 TensorBoard 标量数据。
- 新增独立的自调参 Web 工作台(
web_platform/tuning.html,web_platform/src/tuning/),包含实时曲线可视化组件(ScalarChart.tsx)。 - 训练服务支持将最佳配置保存为不可变预设并在普通训练中复用,支持导出最佳
policy.onnx。 - 本地训练面板(
LocalTrainingPanel.tsx)与训练客户端集成自调参能力探测与快速跳转入口。
[0.7.3] - 2026-09-01
新增
- 将默认
Unitree-Go2-Flat训练所需的 PPO 环境、奖励/观测配置、ONNX 导出逻辑和 Go2 模型资产内置到training_server/rl/。
变更
- 训练服务默认使用仓库内置训练器,不再要求单独克隆
unitree_rl_mjlab;仍可通过--trainer-root覆盖。
[0.7.2] - 2026-09-01
变更
- 前端改为“应用壳 + 业务域 + 共享组件”的目录结构,并补充架构与依赖边界文档。
- 拆分工程侧栏、模型控制侧栏、执行器控制和通用侧栏容器,降低单文件职责和跨域耦合。
- 将地图、控制器、强化学习、本地训练和遥测面板及测试与各自业务域共置。
- 将遥测模块从仿真调度目录独立到
telemetry/,保留通过显式接口与SimulationSession集成。
[0.7.1] - 2026-09-01
新增
- 增加浏览器内仿真遥测记录模块,可配置记录 Body、采样频率和样本上限。
- 记录位置、移动速度、机身侧倾/俯仰/偏航角、角速度、累计里程、接触与驱动指标。
- 增加实时数据与摘要面板,并支持导出稳定列结构的 CSV 和 Schema V1 JSON。
- 提供
TelemetrySource、registerDataChannel及记录生命周期接口,便于扩展业务指标和其他仿真后端。 - 仿真重置使用数据分段,避免跨重置计算错误速度;达到样本上限时自动停止。
[0.6.1] - 2026-08-28
新增
- 固定并强制使用 Node.js、npm、Prettier 和 Ruff 开发工具版本。
- 为核心导入、仿真数学、状态管理和训练客户端增加覆盖率门槛。
- Git 标签触发的自动构建、校验和与 GitHub Release 工作流。
- 本地训练服务随机 Bearer Token 鉴权、Host 校验和任务历史上限。
- 训练进程启动/取消竞态回归测试和 SIGTERM 受控退出。
变更
- Playwright CI 改用版本固定的 Chromium。
- TypeScript、TSX、配置和文档统一使用 Prettier 格式化。
- Python 训练服务统一使用 Ruff 检查和格式化。
[0.6.0] - 2026-08-28
变更
- 将仓库重构为以
web_platform/为核心的 Web 应用仓库。 - MuJoCo 运行时改为依赖官方
@mujoco/mujoconpm 包。 - 移除原生 C++、Python、MJX、Unity、桌面模拟器、CMake 和上游测试镜像。
- 将训练桥接服务和 Python 控制器示例提升到仓库根目录。
[0.5.2] - 2026-08-28
变更
- 优化响应式工作区、可访问性、首屏加载、纹理兼容性和视口交互。
- 增加碰撞体、坐标系、关节轴、质心和惯量辅助可视化。
未发布 — Obstacle DeepSeek 自调参
- 新增Obstacle专属四标量schema与真实reward/导航command应用,保持Flat与护栏CAS语义;导出/浏览器执行配套目标速度。
- 增加固定3seed/1000步、首terminal前捕获的客观导航评价,固定权重和成功/跌倒硬门槛;custom保持权威地图并诚实标注;真实checkpoint/观测统计加载、逐seed进程隔离和失败关闭。
- 自调参界面支持任务选择、专属参数/评估展示、terrain/sensor/custom配置交接及最佳Obstacle策略事务导入;增加mock Agent、打分算例、CAS、argv配置与GPU评估验证。
未发布 — 已训练基础策略迁移与持续导航
- 普通训练与自调参增加已验证基础策略选择、checkpoint/SHA和兼容观测展示;管理员本地注册来源,内容寻址只读快照,拒绝客户端任意路径、symlink、unsafe反序列化及失效来源。
- 严格迁移47维actor到47/81/97:新增列零初始化,保留源归一化统计/count;新trial重置critic/optimizer/iteration,同trial晋级只resume自己的checkpoint,导出保留无路径来源metadata。
- 服务重启后的非终态session等待显式恢复,审计原状态并使旧pending proposal失效重提;保留来源、约束和Approval模式,防重复resume worker。
- 移除浏览器Obstacle交互导航20秒截止,保留训练/固定三seed评估协议及跌倒/越界安全停止;设点不自动启用策略,明确显示暂停/未启用/错误状态。
- 新增来源安全、SHA快照、trial续训/重启、双面板和真实WASM/ORT持续换目标回归;4env×1iteration仅证明初始化与优化,空旷地图实测不代表复杂障碍收敛。
未发布 — 基础策略目录刷新安全修复
- 修复普通训练在刷新服务目录后清掉失效来源、静默降级随机初始化的问题;保留已选内容ID,不按同别名自动替换新内容。
- 两种训练面板统一对目录缺项、验证失败及任务不兼容来源显示失效提示,禁用启动并在handler再次拦截;必须用户明确从头训练或选择有效来源。显式切换任务仍清空选择。
- 增加两面板A→B、not-ready、缺项及兼容性变更的真实组件刷新回归,验证失效时零启动请求及用户明确选择后的请求体。