Hohoo 的 AI 学习之旅

三条主线,一条实践路径

从软件工程,到 AI 与具身智能。围绕一个长期项目,在虚拟世界中学习、验证与构建。

M1 · 未开始

下一步,从一个明确的任务开始

先把自然语言转成可校验的机器人任务,用模拟工具验证 Agent,再逐步接入 ROS2 和虚拟机器人。

自然语言 → 机器人任务

路线图

计划投入比重,非完成进度

01 / 25%

AI 应用工程

  1. LLM API / Prompt
  2. Structured Output / JSON Schema
  3. Tool Calling / Agent Loop
  4. RAG / Memory
  5. Evaluation / Observability

02 / 15%

LLM 与多模态

  1. Tokenizer / Token
  2. Embedding
  3. Transformer / Self Attention
  4. Context Window / Inference
  5. Multimodal / Vision Encoder
  6. VLM / VLA

03 / 60%

具身智能与机器人

  1. Python / Linux / C++17
  2. ROS2
  3. MuJoCo / Gazebo
  4. 机器人数据
  5. ManiSkill / ACT
  6. VLA / Sim2Real
Agent + VLM + 机器人数据 → 具身智能体 → VLA

应用能力与视觉理解,汇入机器人的感知、决策和行动。

M10 →

仿真优先,从虚拟世界开始

前期不购买机器人或专用硬件。按学习阶段选择环境,不要求一次安装四种模拟器;硬件与算力条件在实际实验前单独确认。

  1. VL01

    MuJoCo计划中
  2. VL02

    Gazebo + ROS2计划中
  3. VL03

    ManiSkill计划中
  4. VL04

    Isaac Sim / Isaac Lab未来阶段
主项目目标架构 · hohoo-embodied-agent

目标任务:把桌上的红色方块放进蓝色盒子。

  1. 用户
  2. 对话界面
  3. LLM
  4. AI Agent
  5. 任务规划
  6. VLM
  7. 机器人工具
  8. ROS2
  9. 策略
  10. 仿真引擎
  11. 虚拟机器人
  12. 观测
  13. 机器人数据平台
  14. 数据集
  15. LeRobot Dataset
  16. 训练

机器人数据平台

  1. 虚拟机器人
  2. RGB / Depth / 机器人状态 / 关节状态 / 动作
  3. 数据采集
  4. 时间同步
  5. Episode 构建
  6. MP4 + Parquet
  7. 数据集
  8. 数据质量检查
  9. LeRobot Dataset

运行与学习,两个闭环

机器人运行闭环

  1. 环境
  2. 观测
  3. 感知
  4. 推理与规划
  5. 策略
  6. 行动
  7. 环境

数据与策略迭代

  1. Episode
  2. 数据集
  3. 训练
  4. 新策略
之后,再走向真实世界 · Sim2Real

仿真与真实环境存在差异:光照、纹理、摩擦、相机位姿、传感器噪声、物体位置及机器人动力学都可能影响迁移。后续再研究领域随机化与真实环境评估。

  1. 仿真引擎
  2. 训练
  3. 评估
  4. 领域随机化
  5. 鲁棒策略
  6. 真实机器人

第二阶段:高级仿真与迁移

未来阶段
  • Isaac Sim
  • Isaac Lab
  • 合成数据
  • 领域随机化
  • 并行仿真
  • Sim2Real
  • TensorRT
  • Jetson
  • 机器人部署

第三阶段:真实机器人验证

未来阶段
  • 机械臂
  • 相机
  • 遥操作
  • 数据集采集
  • ACT 部署
  • VLA 部署
  • Sim2Real 评估

真实硬件只属于后期验证,不是当前学习前置条件。

里程碑

  • 未开始
  • 学习中
  • 实践中
  • 已完成
  1. M1自然语言 → 机器人任务未开始

    验证目标

    把“红色方块放进蓝色盒子”转成结构化任务,校验 JSON Schema、动作与参数,拒绝无效任务。

    依赖

    知识与工具

    • LLM API
    • Prompt
    • System Prompt
    • Streaming
    • Structured Output
    • JSON Schema
    已有基础参考 · Java 8 调用大语言模型:从第一次请求到多轮对话

    下一阶段

  2. M2机器人 Agent 与模拟工具未开始

    验证目标

    用模拟工具验证 Agent Loop,记录调用、工具失败和停止条件;此阶段不控制真实机器人。

    依赖

    知识与工具

    • Tool Calling
    • Agent Loop
    • get_scene
    • find_object
    • move_to
    • grasp
    • place
    • get_robot_state

    下一阶段

  3. M3Agent 接入 ROS2未开始

    验证目标

    逐步把 Python 模拟工具替换为 ROS2 工具或机器人桥接层,验证调用、反馈与取消。

    依赖

    知识与工具

    • Linux
    • Python
    • C++17
    • CMake
    • GDB
    • Docker
    • ROS2
    • Node
    • Topic
    • Service
    • Action
    • Launch

    虚拟实验室

    下一阶段

  4. M4ROS2 → 虚拟机器人未开始

    验证目标

    优先连接 MuJoCo,之后按需加入 Gazebo,验证 Agent → ROS2 → 虚拟机器人的控制与观测链路。

    依赖

    知识与工具

    • MuJoCo
    • Gazebo
    • ROS2
    • Robot Bridge

    虚拟实验室

    下一阶段

  5. M5虚拟抓取与放置未开始

    验证目标

    在 MuJoCo 中用虚拟机械臂把红色方块放进蓝色盒子,记录轨迹、控制与失败情况。

    依赖

    知识与工具

    • Joint
    • Link
    • DOF
    • Pose
    • Coordinate Frame
    • Joint Space
    • Cartesian Space
    • FK
    • IK
    • Jacobian
    • Trajectory
    • Controller

    虚拟实验室

    下一阶段

  6. M6机器人数据平台未开始

    验证目标

    采集 RGB、机器人与关节状态、动作、时间戳、任务与成功标记;构建 Episode,验证同步、编码、存储和数据质量。

    依赖

    知识与工具

    • Observation
    • Action
    • State
    • Frame
    • Episode
    • Trajectory
    • Dataset
    • Timestamp
    • FFmpeg
    • MP4
    • Parquet
    • PyArrow
    • MCAP
    • 对象存储
    • 数据质量
    • LeRobot Dataset

    虚拟实验室

    下一阶段

  7. M7机器人知识助手未开始

    验证目标

    从机器人手册、ROS2 文档、错误码与操作记录检索依据,辅助诊断并展示来源;测试无依据的问题。

    依赖

    知识与工具

    • Embedding
    • RAG
    • Vector Database
    • Agent Memory
    • Context Engineering
    • Evaluation
    • Observability

    下一阶段

  8. M8虚拟视觉与 VLM未开始

    验证目标

    从人工提供场景 JSON 演进到虚拟相机 RGB / Depth 输入,对照真实场景配置验证视觉判断,并记录局限。

    依赖

    知识与工具

    • 相机
    • RGB
    • Depth
    • Tokenizer
    • Token
    • Transformer
    • Self Attention
    • Context Window
    • Inference
    • Multimodal
    • Vision Encoder
    • VLM

    虚拟实验室

    下一阶段

  9. M9机器人策略学习未开始

    验证目标

    用机器人数据、LeRobot、PyTorch 与 ACT 训练或复现策略,记录动作分块在虚拟机器人中的执行与评估。

    依赖

    知识与工具

    • PyTorch
    • Behavior Cloning
    • Imitation Learning
    • LeRobot
    • ACT
    • ManiSkill
    • Diffusion Policy

    虚拟实验室

    下一阶段

  10. M10VLA 虚拟机器人未开始

    验证目标

    在条件允许时选择 SmolVLA 或适合的轻量 VLA,将视觉、语言与机器人状态映射为动作;先在虚拟环境中验证。

    依赖

    知识与工具

    • RT-1
    • RT-2
    • Octo
    • OpenVLA
    • SmolVLA
    • π0
    • π0.5
    • GR00T
    • VLA

    虚拟实验室

建议节奏

8 周是可调整的学习安排,不是完成承诺;尚未设置开始日期。

  1. 第 1 周
  2. 第 2 周
  3. 第 3 周
  4. 第 4 周
  5. 第 5 周
  6. 第 6 周
  7. 第 7 周
  8. 第 8 周

已有基础参考

Java 8 调用大语言模型:从第一次请求到多轮对话

这篇已发布教程可复习请求、响应解析与会话历史;它不代表机器人任务里程碑已完成。

以后再探索

先完成一条端到端链路,再根据实际问题扩展。

  • SLAM
  • MPC
  • WBC
  • 高级动力学
  • 人形机器人运动
  • CUDA Kernel
  • 分布式 VLA 训练
  • 世界模型训练
  • 高级强化学习
  • 真实机器人硬件
  • Isaac Sim 深度优化
  • Isaac Lab 大规模训练
  • TensorRT 深度优化