Hohoo 的 AI 學習之旅

三條主線,一條實作路徑

從軟體工程,到 AI 與具身智慧。圍繞一個長期專案,在虛擬世界中學習、驗證與構建。

M1 · 未開始

下一步,從一個明確的任務開始

先把自然語言轉成可驗證的機器人任務,用模擬工具驗證 Agent,再逐步接入 ROS2 與虛擬機器人。

自然語言 → 機器人任務

路線圖

計畫投入比重,非完成進度

01 / 25%

AI 應用工程

  1. LLM API / Prompt
  2. Structured Output / JSON Schema
  3. Tool Calling / Agent Loop
  4. RAG / Memory
  5. Evaluation / Observability

02 / 15%

LLM 與多模態

  1. Tokenizer / Token
  2. Embedding
  3. Transformer / Self Attention
  4. Context Window / Inference
  5. Multimodal / Vision Encoder
  6. VLM / VLA

03 / 60%

具身智慧與機器人

  1. Python / Linux / C++17
  2. ROS2
  3. MuJoCo / Gazebo
  4. 機器人資料
  5. ManiSkill / ACT
  6. VLA / Sim2Real
Agent + VLM + 機器人資料 → 具身智慧代理 → VLA

應用能力與視覺理解,匯入機器人的感知、決策和行動。

M10 →

模擬優先,從虛擬世界開始

前期不購買機器人或專用硬體。依學習階段選擇環境,不要求一次安裝四種模擬器;硬體與運算資源在實際實驗前個別確認。

  1. VL01

    MuJoCo計畫中
  2. VL02

    Gazebo + ROS2計畫中
  3. VL03

    ManiSkill計畫中
  4. VL04

    Isaac Sim / Isaac Lab未來階段
主專案目標架構 · hohoo-embodied-agent

目標任務:把桌上的紅色方塊放進藍色盒子。

  1. 使用者
  2. 對話介面
  3. LLM
  4. AI Agent
  5. 任務規劃
  6. VLM
  7. 機器人工具
  8. ROS2
  9. 策略
  10. 模擬引擎
  11. 虛擬機器人
  12. 觀測
  13. 機器人資料平台
  14. 資料集
  15. LeRobot Dataset
  16. 訓練

機器人資料平台

  1. 虛擬機器人
  2. RGB / Depth / 機器人狀態 / 關節狀態 / 動作
  3. 資料採集
  4. 時間同步
  5. Episode 建立
  6. MP4 + Parquet
  7. 資料集
  8. 資料品質檢查
  9. LeRobot Dataset

運行與學習,兩個閉環

機器人運行閉環

  1. 環境
  2. 觀測
  3. 感知
  4. 推理與規劃
  5. 策略
  6. 行動
  7. 環境

資料與策略迭代

  1. Episode
  2. 資料集
  3. 訓練
  4. 新策略
之後,再走向真實世界 · Sim2Real

模擬與真實環境存在差異:光照、紋理、摩擦、相機位姿、感測器雜訊、物體位置及機器人動力學都可能影響遷移。後續再研究領域隨機化與真實環境評估。

  1. 模擬引擎
  2. 訓練
  3. 評估
  4. 領域隨機化
  5. 穩健策略
  6. 真實機器人

第二階段:進階模擬與遷移

未來階段
  • Isaac Sim
  • Isaac Lab
  • 合成資料
  • 領域隨機化
  • 平行模擬
  • Sim2Real
  • TensorRT
  • Jetson
  • 機器人部署

第三階段:真實機器人驗證

未來階段
  • 機械臂
  • 相機
  • 遙操作
  • 資料集採集
  • ACT 部署
  • VLA 部署
  • Sim2Real 評估

真實硬體只屬於後期驗證,不是目前學習的前置條件。

里程碑

  • 未開始
  • 學習中
  • 實作中
  • 已完成
  1. M1自然語言 → 機器人任務未開始

    驗證目標

    把「紅色方塊放進藍色盒子」轉成結構化任務,驗證 JSON Schema、動作與參數,拒絕無效任務。

    相依項目

    知識與工具

    • LLM API
    • Prompt
    • System Prompt
    • Streaming
    • Structured Output
    • JSON Schema
    已有基礎參考 · Java 8 呼叫大型語言模型:從第一次請求到多輪對話

    下一階段

  2. M2機器人 Agent 與模擬工具未開始

    驗證目標

    用模擬工具驗證 Agent Loop,記錄呼叫、工具失敗與停止條件;此階段不控制真實機器人。

    相依項目

    知識與工具

    • Tool Calling
    • Agent Loop
    • get_scene
    • find_object
    • move_to
    • grasp
    • place
    • get_robot_state

    下一階段

  3. M3Agent 接入 ROS2未開始

    驗證目標

    逐步將 Python 模擬工具替換為 ROS2 工具或機器人橋接層,驗證呼叫、回饋與取消。

    相依項目

    知識與工具

    • Linux
    • Python
    • C++17
    • CMake
    • GDB
    • Docker
    • ROS2
    • Node
    • Topic
    • Service
    • Action
    • Launch

    虛擬實驗室

    下一階段

  4. M4ROS2 → 虛擬機器人未開始

    驗證目標

    優先連接 MuJoCo,之後依需求加入 Gazebo,驗證 Agent → ROS2 → 虛擬機器人的控制與觀測鏈路。

    相依項目

    知識與工具

    • MuJoCo
    • Gazebo
    • ROS2
    • Robot Bridge

    虛擬實驗室

    下一階段

  5. M5虛擬抓取與放置未開始

    驗證目標

    在 MuJoCo 中用虛擬機械臂把紅色方塊放進藍色盒子,記錄軌跡、控制與失敗情況。

    相依項目

    知識與工具

    • Joint
    • Link
    • DOF
    • Pose
    • Coordinate Frame
    • Joint Space
    • Cartesian Space
    • FK
    • IK
    • Jacobian
    • Trajectory
    • Controller

    虛擬實驗室

    下一階段

  6. M6機器人資料平台未開始

    驗證目標

    採集 RGB、機器人與關節狀態、動作、時間戳記、任務與成功標記;建立 Episode,驗證同步、編碼、儲存與資料品質。

    相依項目

    知識與工具

    • Observation
    • Action
    • State
    • Frame
    • Episode
    • Trajectory
    • Dataset
    • Timestamp
    • FFmpeg
    • MP4
    • Parquet
    • PyArrow
    • MCAP
    • 物件儲存
    • 資料品質
    • LeRobot Dataset

    虛擬實驗室

    下一階段

  7. M7機器人知識助手未開始

    驗證目標

    從機器人手冊、ROS2 文件、錯誤碼與操作紀錄檢索依據,輔助診斷並顯示來源;測試無依據的問題。

    相依項目

    知識與工具

    • Embedding
    • RAG
    • Vector Database
    • Agent Memory
    • Context Engineering
    • Evaluation
    • Observability

    下一階段

  8. M8虛擬視覺與 VLM未開始

    驗證目標

    從人工提供場景 JSON 演進到虛擬相機 RGB / Depth 輸入,對照實際場景設定驗證視覺判斷,並記錄限制。

    相依項目

    知識與工具

    • 相機
    • RGB
    • Depth
    • Tokenizer
    • Token
    • Transformer
    • Self Attention
    • Context Window
    • Inference
    • Multimodal
    • Vision Encoder
    • VLM

    虛擬實驗室

    下一階段

  9. M9機器人策略學習未開始

    驗證目標

    用機器人資料、LeRobot、PyTorch 與 ACT 訓練或重現策略,記錄動作區塊在虛擬機器人中的執行與評估。

    相依項目

    知識與工具

    • PyTorch
    • Behavior Cloning
    • Imitation Learning
    • LeRobot
    • ACT
    • ManiSkill
    • Diffusion Policy

    虛擬實驗室

    下一階段

  10. M10VLA 虛擬機器人未開始

    驗證目標

    在條件允許時選擇 SmolVLA 或適合的輕量 VLA,將視覺、語言與機器人狀態映射為動作;先在虛擬環境中驗證。

    相依項目

    知識與工具

    • RT-1
    • RT-2
    • Octo
    • OpenVLA
    • SmolVLA
    • π0
    • π0.5
    • GR00T
    • VLA

    虛擬實驗室

建議節奏

8 週是可調整的學習安排,不是完成承諾;尚未設定開始日期。

  1. 第 1 週
  2. 第 2 週
  3. 第 3 週
  4. 第 4 週
  5. 第 5 週
  6. 第 6 週
  7. 第 7 週
  8. 第 8 週

已有基礎參考

Java 8 呼叫大型語言模型:從第一次請求到多輪對話

這篇已發佈教學可複習請求、回應解析與對話歷史;它不代表機器人任務里程碑已完成。

以後再探索

先完成一條端到端鏈路,再依據實際問題擴展。

  • SLAM
  • MPC
  • WBC
  • 進階動力學
  • 人形機器人運動
  • CUDA Kernel
  • 分散式 VLA 訓練
  • 世界模型訓練
  • 進階強化學習
  • 真實機器人硬體
  • Isaac Sim 深度最佳化
  • Isaac Lab 大規模訓練
  • TensorRT 深度最佳化