Hohoo 的 AI 学习之旅
三条主线,一条实践路径
从软件工程,到 AI 与具身智能。围绕一个长期项目,在虚拟世界中学习、验证与构建。
路线图
计划投入比重,非完成进度
01 / 25%
AI 应用工程
- LLM API / Prompt
- Structured Output / JSON Schema
- Tool Calling / Agent Loop
- RAG / Memory
- Evaluation / Observability
02 / 15%
LLM 与多模态
- Tokenizer / Token
- Embedding
- Transformer / Self Attention
- Context Window / Inference
- Multimodal / Vision Encoder
- VLM / VLA
03 / 60%
具身智能与机器人
- Python / Linux / C++17
- ROS2
- MuJoCo / Gazebo
- 机器人数据
- ManiSkill / ACT
- VLA / Sim2Real
应用能力与视觉理解,汇入机器人的感知、决策和行动。
M10 →仿真优先,从虚拟世界开始
前期不购买机器人或专用硬件。按学习阶段选择环境,不要求一次安装四种模拟器;硬件与算力条件在实际实验前单独确认。
VL01
MuJoCo →计划中VL02
Gazebo + ROS2 →计划中VL03
ManiSkill →计划中VL04
Isaac Sim / Isaac Lab →未来阶段
主项目目标架构 · hohoo-embodied-agent
目标任务:把桌上的红色方块放进蓝色盒子。
- 用户
- 对话界面
- LLM
- AI Agent
- 任务规划
- VLM
- 机器人工具
- ROS2
- 策略
- 仿真引擎
- 虚拟机器人
- 观测
- 机器人数据平台
- 数据集
- LeRobot Dataset
- 训练
机器人数据平台
- 虚拟机器人
- RGB / Depth / 机器人状态 / 关节状态 / 动作
- 数据采集
- 时间同步
- Episode 构建
- MP4 + Parquet
- 数据集
- 数据质量检查
- LeRobot Dataset
运行与学习,两个闭环
机器人运行闭环
- 环境
- 观测
- 感知
- 推理与规划
- 策略
- 行动
- 环境
数据与策略迭代
- Episode
- 数据集
- 训练
- 新策略
之后,再走向真实世界 · Sim2Real
仿真与真实环境存在差异:光照、纹理、摩擦、相机位姿、传感器噪声、物体位置及机器人动力学都可能影响迁移。后续再研究领域随机化与真实环境评估。
- 仿真引擎
- 训练
- 评估
- 领域随机化
- 鲁棒策略
- 真实机器人
第二阶段:高级仿真与迁移
未来阶段第三阶段:真实机器人验证
未来阶段真实硬件只属于后期验证,不是当前学习前置条件。
里程碑
- 未开始
- 学习中
- 实践中
- 已完成
M1自然语言 → 机器人任务未开始
验证目标
把“红色方块放进蓝色盒子”转成结构化任务,校验 JSON Schema、动作与参数,拒绝无效任务。
依赖
从这里开始知识与工具
已有基础参考 · Java 8 调用大语言模型:从第一次请求到多轮对话 →下一阶段
M2机器人 Agent 与模拟工具未开始
M3Agent 接入 ROS2未开始
验证目标
逐步把 Python 模拟工具替换为 ROS2 工具或机器人桥接层,验证调用、反馈与取消。
依赖
知识与工具
虚拟实验室
下一阶段
M4ROS2 → 虚拟机器人未开始
验证目标
优先连接 MuJoCo,之后按需加入 Gazebo,验证 Agent → ROS2 → 虚拟机器人的控制与观测链路。
依赖
知识与工具
虚拟实验室
下一阶段
M5虚拟抓取与放置未开始
验证目标
在 MuJoCo 中用虚拟机械臂把红色方块放进蓝色盒子,记录轨迹、控制与失败情况。
依赖
知识与工具
虚拟实验室
下一阶段
M6机器人数据平台未开始
验证目标
采集 RGB、机器人与关节状态、动作、时间戳、任务与成功标记;构建 Episode,验证同步、编码、存储和数据质量。
依赖
知识与工具
虚拟实验室
下一阶段
M7机器人知识助手未开始
验证目标
从机器人手册、ROS2 文档、错误码与操作记录检索依据,辅助诊断并展示来源;测试无依据的问题。
依赖
知识与工具
下一阶段
M8虚拟视觉与 VLM未开始
验证目标
从人工提供场景 JSON 演进到虚拟相机 RGB / Depth 输入,对照真实场景配置验证视觉判断,并记录局限。
依赖
知识与工具
虚拟实验室
下一阶段
M9机器人策略学习未开始
验证目标
用机器人数据、LeRobot、PyTorch 与 ACT 训练或复现策略,记录动作分块在虚拟机器人中的执行与评估。
依赖
知识与工具
虚拟实验室
下一阶段
M10VLA 虚拟机器人未开始
验证目标
在条件允许时选择 SmolVLA 或适合的轻量 VLA,将视觉、语言与机器人状态映射为动作;先在虚拟环境中验证。
依赖
知识与工具
虚拟实验室
建议节奏
8 周是可调整的学习安排,不是完成承诺;尚未设置开始日期。
- 第 1 周
- 第 2 周
- 第 3 周
- 第 4 周
- 第 5 周
- 第 6 周
- 第 7 周
- 第 8 周
已有基础参考
Java 8 调用大语言模型:从第一次请求到多轮对话 →这篇已发布教程可复习请求、响应解析与会话历史;它不代表机器人任务里程碑已完成。
以后再探索
先完成一条端到端链路,再根据实际问题扩展。