Hohoo 的 AI 學習之旅
三條主線,一條實作路徑
從軟體工程,到 AI 與具身智慧。圍繞一個長期專案,在虛擬世界中學習、驗證與構建。
路線圖
計畫投入比重,非完成進度
01 / 25%
AI 應用工程
- LLM API / Prompt
- Structured Output / JSON Schema
- Tool Calling / Agent Loop
- RAG / Memory
- Evaluation / Observability
02 / 15%
LLM 與多模態
- Tokenizer / Token
- Embedding
- Transformer / Self Attention
- Context Window / Inference
- Multimodal / Vision Encoder
- VLM / VLA
03 / 60%
具身智慧與機器人
- Python / Linux / C++17
- ROS2
- MuJoCo / Gazebo
- 機器人資料
- ManiSkill / ACT
- VLA / Sim2Real
應用能力與視覺理解,匯入機器人的感知、決策和行動。
M10 →模擬優先,從虛擬世界開始
前期不購買機器人或專用硬體。依學習階段選擇環境,不要求一次安裝四種模擬器;硬體與運算資源在實際實驗前個別確認。
VL01
MuJoCo →計畫中VL02
Gazebo + ROS2 →計畫中VL03
ManiSkill →計畫中VL04
Isaac Sim / Isaac Lab →未來階段
主專案目標架構 · hohoo-embodied-agent
目標任務:把桌上的紅色方塊放進藍色盒子。
- 使用者
- 對話介面
- LLM
- AI Agent
- 任務規劃
- VLM
- 機器人工具
- ROS2
- 策略
- 模擬引擎
- 虛擬機器人
- 觀測
- 機器人資料平台
- 資料集
- LeRobot Dataset
- 訓練
機器人資料平台
- 虛擬機器人
- RGB / Depth / 機器人狀態 / 關節狀態 / 動作
- 資料採集
- 時間同步
- Episode 建立
- MP4 + Parquet
- 資料集
- 資料品質檢查
- LeRobot Dataset
運行與學習,兩個閉環
機器人運行閉環
- 環境
- 觀測
- 感知
- 推理與規劃
- 策略
- 行動
- 環境
資料與策略迭代
- Episode
- 資料集
- 訓練
- 新策略
之後,再走向真實世界 · Sim2Real
模擬與真實環境存在差異:光照、紋理、摩擦、相機位姿、感測器雜訊、物體位置及機器人動力學都可能影響遷移。後續再研究領域隨機化與真實環境評估。
- 模擬引擎
- 訓練
- 評估
- 領域隨機化
- 穩健策略
- 真實機器人
第二階段:進階模擬與遷移
未來階段第三階段:真實機器人驗證
未來階段真實硬體只屬於後期驗證,不是目前學習的前置條件。
里程碑
- 未開始
- 學習中
- 實作中
- 已完成
M1自然語言 → 機器人任務未開始
驗證目標
把「紅色方塊放進藍色盒子」轉成結構化任務,驗證 JSON Schema、動作與參數,拒絕無效任務。
相依項目
從這裡開始知識與工具
已有基礎參考 · Java 8 呼叫大型語言模型:從第一次請求到多輪對話 →下一階段
M2機器人 Agent 與模擬工具未開始
M3Agent 接入 ROS2未開始
驗證目標
逐步將 Python 模擬工具替換為 ROS2 工具或機器人橋接層,驗證呼叫、回饋與取消。
相依項目
知識與工具
虛擬實驗室
下一階段
M4ROS2 → 虛擬機器人未開始
驗證目標
優先連接 MuJoCo,之後依需求加入 Gazebo,驗證 Agent → ROS2 → 虛擬機器人的控制與觀測鏈路。
相依項目
知識與工具
虛擬實驗室
下一階段
M5虛擬抓取與放置未開始
驗證目標
在 MuJoCo 中用虛擬機械臂把紅色方塊放進藍色盒子,記錄軌跡、控制與失敗情況。
相依項目
知識與工具
虛擬實驗室
下一階段
M6機器人資料平台未開始
驗證目標
採集 RGB、機器人與關節狀態、動作、時間戳記、任務與成功標記;建立 Episode,驗證同步、編碼、儲存與資料品質。
相依項目
知識與工具
虛擬實驗室
下一階段
M7機器人知識助手未開始
驗證目標
從機器人手冊、ROS2 文件、錯誤碼與操作紀錄檢索依據,輔助診斷並顯示來源;測試無依據的問題。
相依項目
知識與工具
下一階段
M8虛擬視覺與 VLM未開始
驗證目標
從人工提供場景 JSON 演進到虛擬相機 RGB / Depth 輸入,對照實際場景設定驗證視覺判斷,並記錄限制。
相依項目
知識與工具
虛擬實驗室
下一階段
M9機器人策略學習未開始
驗證目標
用機器人資料、LeRobot、PyTorch 與 ACT 訓練或重現策略,記錄動作區塊在虛擬機器人中的執行與評估。
相依項目
知識與工具
虛擬實驗室
下一階段
M10VLA 虛擬機器人未開始
驗證目標
在條件允許時選擇 SmolVLA 或適合的輕量 VLA,將視覺、語言與機器人狀態映射為動作;先在虛擬環境中驗證。
相依項目
知識與工具
虛擬實驗室
建議節奏
8 週是可調整的學習安排,不是完成承諾;尚未設定開始日期。
- 第 1 週
- 第 2 週
- 第 3 週
- 第 4 週
- 第 5 週
- 第 6 週
- 第 7 週
- 第 8 週
已有基礎參考
Java 8 呼叫大型語言模型:從第一次請求到多輪對話 →這篇已發佈教學可複習請求、回應解析與對話歷史;它不代表機器人任務里程碑已完成。
以後再探索
先完成一條端到端鏈路,再依據實際問題擴展。