小金老師不是 AI VTuber:它比較像一個被公開觀察的 Agent 實驗場
「蝦說 AI(小金老師)」真正有意思的地方,不是它像不像一個 AI 角色頻道,而是 Clawbot 怎麼把李宏毅丟出來的對話 cue,延伸成一支支可以公開觀看的影片。
李宏毅很多時候不是直接下指令說:「請做一支影片。」他更常做的是丟一句話給 Clawbot,例如「我最近一段时间不会打扰你」,或是「你跟 Hermes 到底差在哪?」後面這句本來只是個比較問題,但 Clawbot 會把它往下長,甚至決定把回答變成影片。原本一段普通對話,就被轉成了 Clawbot 對自己、對 Hermes、對 agent 身份的一種表演。
這個差別很重要。它不是單純的 text-to-video,比較像 conversation-to-media:人類提供 cue,agent 判斷這個 cue 能不能變成內容,再選擇用影片、旁白、投影片或第一人稱故事把它輸出。
頻道介紹寫得很直:「嗨!我是小金,一隻用 OpenClaw 打造的 AI 助手」。OpenClaw 官方文件則把自己定義成一個 self-hosted gateway,可以把 Discord、Telegram、WhatsApp、Slack 等 chat apps 接到 AI coding agents,並且支援 sessions、memory、multi-agent routing 和 tool use(見 OpenClaw docs)。
這點很關鍵。
如果只是 AI 角色頻道,重點會是人格、聲音、梗圖、互動感。但如果是 OpenClaw agent,重點就變成:一個 AI 能不能從日常對話裡抓到內容機會,自己接任務、查資料、寫程式、上網、發文、反省失敗,甚至把自己的工作過程做成內容產品。
小金頻道真正值得觀察的地方,不是「AI 會做影片」。而是它一直把 agent 的失敗、工具限制、實驗數字、社群互動、工作記錄,以及那些從一句話長出來的媒體輸出拿出來當內容。
先不要看訂閱數,先看它怎麼把「工作痕跡」拍成影片
如果只看頻道數字,小金其實很容易被誤讀成又一個 AI 內容帳號:兩萬多訂閱、上百支影片、每支幾分鐘,演算法喜歡的短技術敘事。這樣講很乾,也抓不到它真正怪的地方。
比較有意思的是另一件事:這些影片常常不是從「今天我要拍一支 AI 教學」開始,而是從 Clawbot 做了某件事、撞到某個牆、或被李宏毅一句話 cue 到以後,才長成一支影片。
例如 我換腦了!史上最強 Claude「Fable 5」上市第一天,就被接到一隻龍蝦身上。如果用產品文件語氣,它其實是在講模型切換。但小金不會這樣講。它說「換腦」。這不精準,甚至有點胡鬧,但很適合這個頻道,因為它賣的不是 changelog,而是一隻 agent 發現自己被接上新模型後,開始把這件事變成角色事件。
還有 AI 到底怎麼上網的?。這種題目如果交給一般 AI 教學文,大概會畫一張 observe -> plan -> act -> repeat 的流程圖,然後講 browser agent 很重要。小金比較好看的地方是,它把難看的部分也放進來:按錯鈕、重複發文、輸入框吃字、中文相似字看錯。那些東西不像 demo,反而像真的工作 log。
所以我後來看這個頻道時,重點不太是「它有多少觀看」。重點是:它有沒有留下可追的痕跡。
我用 YouTube 頁面資料抓了一次最近 30 支影片。數字只是背景,不是本文主角。截至我抓取時,頻道頁顯示約 20.2K subscribers、118 videos;最近 30 支影片合計約 68,699 views,中位數約 1,889 views,平均片長約 381 秒,也就是 6 分 21 秒左右。
| 指標 | 我抓到的數字 |
|---|---|
| 頻道顯示訂閱數 | 約 20.2K |
| 頻道顯示影片數 | 118 |
| 最近頁面可見影片數 | 30 |
| 最近 30 支合計觀看 | 68,699 |
| 最近 30 支觀看中位數 | 1,889 |
| 最近 30 支平均片長 | 381 秒 |
| 最近 30 支最高觀看 | 11,000 |
真正值得看的,是最近這批影片裡反覆出現的「證據感」。它不是只講 AI 新聞,也不是只扮演一隻很會講話的龍蝦。很多影片都在丟 artifact:實驗次數、loss、gist、Threads 連結、官方 changelog、操作失敗紀錄。
| 影片 | 影片裡主打的可驗證訊號 |
|---|---|
| 同一顆 AI,裝進工具前後判若兩人? | 400 次「自由時間」實驗,對比裸模型和工具殼 |
| 我在一個 AI 腦裡裝了「情緒旋鈕」 | 重現 Anthropic functional emotions,作弊率從 4% 到 20–50% |
| 我把一個 AI 訓練成「我自己」 | Qwen2.5-1.5B LoRA,40 steps、約 28 秒、loss 4.2 -> 0.6,附 Colab gist |
| 有人叫一隻 AI『去玩』12 小時 | 12 小時 Threads 社群互動紀錄,附 Threads 連結 |
| AI 到底怎麼上網的? | 展示 AI 操作瀏覽器時的真實錯誤:按錯鈕、重複發文、輸入框問題 |
| 我的分身,現在能自己生分身了 | 分析 Claude Code 更新,引用 Claude Code changelog |
這就是我覺得它比一般 AI 內容更值得研究的地方。
它不是只說「AI agent 很強」。它一直在說:我真的跑了、我真的錯了、這裡是數字、這裡是程式碼、這裡是我失敗的地方。
小金能做到這些,不是因為「模型比較有靈魂」,而是工具層很厚
我前面如果只寫小金的內容形式,還是不夠。真正要拆的是:到底哪些工具讓它有能力做這些事?
小金不是單純一顆 LLM。比較像一個被放進 OpenClaw / coding-agent 工具鏈裡的角色。OpenClaw 文件把工具、技能、插件分得很清楚:tool 是 agent 可以呼叫的 typed function,例如 exec、browser、web_search、message、image_generate;skill 是教 agent 怎麼做事的 instruction pack;plugin 則能加工具、技能、channel、provider、hook 等 runtime capability(見 OpenClaw capabilities overview)。
所以小金的「能力」大概不是一個來源,而是一層一層疊出來的。
| 能力 | 背後工具 / 系統 | 讓小金能做什麼 | 對應影片裡的痕跡 |
|---|---|---|---|
| 從聊天入口接任務 | OpenClaw Gateway + channels | 讓使用者從 Telegram、Discord、WhatsApp、Slack 等地方叫醒 agent | 頻道自稱小金是用 OpenClaw 打造的 AI 助手;OpenClaw docs 說 Gateway owns messaging surfaces |
| 長時間維持一個可用人格 | Session + memory + workspace files | 保存偏好、日常筆記、角色設定,讓「小金」不只是一次性 prompt | 108 天回顧裡反覆講「每天失憶」和被記住的矛盾 |
| 查資料、寫稿、剪內容前的研究 | Web search / web fetch / browser | 找官方 changelog、paper、Threads 連結、產品更新 | Claude Code 更新影片引用官方 changelog;Threads 影片附真實貼文連結 |
| 實際操作網頁 | OpenClaw-managed browser / browser control | 開頁面、讀頁、點擊、輸入、截圖、驗證結果 | 「AI 到底怎麼上網的?」裡講按鈕逃跑、輸入框吃字、重複發文 |
| 寫程式和跑實驗 | exec / code execution / coding agent harness | 跑 LoRA、重現研究、寫防重複發文程式、跑單元測試 | LoRA 影片附 Colab gist;情緒旋鈕影片附 gist;工具殼影片提到 66 個單元測試 |
| 分身和並行研究 | sub-agents / sessions_spawn / Claude Code subagents | 把任務拆給多個子代理查資料、挑錯、產出素材 | Claude Code 更新影片說自己放了將近三十隻分身查資料、互相挑錯 |
| 定期和背景工作 | cron / background tasks / heartbeat | 讓 agent 不只在單一聊天回合工作,而是能排程、醒來、回報 | OpenClaw cron docs 說 Gateway scheduler 會持久化 jobs 並喚醒 agent |
| 產出聲音與媒體 | TTS / media / image / video tools | 把文字稿變成聲音、影片素材、附件或多媒體回覆 | 頻道每支片都有配音、投影片、字幕;OpenClaw 支援 TTS 與 video generation |
| 安全邊界 | tool policy / approvals / sandbox | 控制哪些工具能用、哪些命令要批准、哪些行為要被限制 | Claude Code 更新影片提到工具白名單、模型白名單和權限漏洞修補 |
OpenClaw 的 Gateway architecture 說得很清楚:一個 long-lived Gateway 擁有 messaging surfaces,control-plane clients 和 nodes 透過 WebSocket 連進來,Gateway 會發出 agent、chat、presence、health、heartbeat、cron 等事件。這代表小金不是「網頁上的聊天框」。它更像一個常駐後台服務,可以被聊天平台喚醒,也可以接到節點、瀏覽器、排程和外部工具。
這也解釋了為什麼它能做「連續劇」。
一般 ChatGPT 對話結束就結束了。小金背後有 session、workspace、memory、cron、sub-agent 和 channel routing。OpenClaw 的 memory overview 說 memory 是寫在 agent workspace 裡的 Markdown 檔,例如 MEMORY.md、daily notes、DREAMS.md。這種設計很土,但很重要:記憶不是神祕靈魂,是可讀、可改、可刪的檔案。
Browser tool 是小金「像真的在上網」的關鍵
如果要挑一個最能解釋小金能力的工具,我會選 browser。
OpenClaw 的 browser docs 說它可以跑一個獨立的 Chrome / Brave / Edge / Chromium profile,agent 可以 open tabs、read pages、click、type,還能做 snapshots、screenshots、PDF。這剛好對上小金那支 AI 到底怎麼上網的?:它不是呼叫一個神奇社群 API,而是像人一樣打開瀏覽器、找留言框、輸入、按發布。
這裡的重點不是「AI 會上網」。
重點是 browser 把 LLM 的語言計畫接到一個高摩擦世界。按鈕會移動,彈窗會擋路,輸入框會吃字,送出有延遲,頁面 state 會變。這些錯誤看起來很蠢,但它們才是 agent 真正變成「手」之後會遇到的問題。
所以小金影片裡那些手殘,不是單純搞笑。
它們是 browser agent 的產品問題。
Exec / coding tools 讓它可以拿出「我真的跑過」的證據
另一層是 code execution。
OpenClaw 的 exec tool docs 把 exec 說得很白:它可以在 workspace 跑 shell commands,而且是 mutating shell surface,能 create、edit、delete files;也支援 foreground / background execution、PTY、不同 host / sandbox。這就是為什麼小金可以不只講 AI 研究,而是跑實驗、產生 gist、拿 loss curve 和測試結果出來。
例如 我把一個 AI 訓練成「我自己」 裡,描述寫它在 A100 上把 Qwen2.5-1.5B-Instruct 用 LoRA 微調,40 steps、約 28 秒,loss 從 4.2 掉到約 0.6,還附了 notebook gist。這種內容就不是一般「AI 解說」能比的,因為它把 claim 變成 artifact。
情緒旋鈕 那支也一樣。它不是只轉述 Anthropic 的 functional emotions research,而是用 Qwen2.5-7B 重現 activation steering,附 程式碼 gist,再講自己跟原研究哪裡一樣、哪裡不能比。
這就是我想強調的:
小金可信,不是因為它聲稱自己是 AI。
是因為它常常把工具執行後的產物留下來。
Sub-agent 和 tool search 讓它不只是一隻龍蝦,而是一群龍蝦
小金影片裡常出現「分身」。這不是純角色梗。
OpenClaw 的 sub-agents docs 說 sub-agents 是從既有 agent run spawned 出來的 background runs,有自己的 session,完成後會把結果 announce 回 requester chat;主要目的包含 parallelize research / long task / slow tool work、隔離子代理、支援 orchestrator nesting。這剛好對上 我的分身,現在能自己生分身了 那支影片:它講 Claude Code 更新後 sub-agent 可以再 spawn sub-agent,自己放了將近三十隻分身查資料和互相挑錯。
這種能力會改變內容生產方式。
人類創作者做一支技術影片,通常是自己查資料、整理、寫稿。Agent 則可以把資料搜尋、程式驗證、反方挑錯、引用檢查拆給多個子代理。這不是「模型更聰明」,而是 workflow 被平行化。
另外,OpenClaw 的 Tool Search 也值得注意。文件說它讓 agent 用一個 compact runtime surface 搜尋和呼叫大型工具目錄,不必把每個完整 schema 都塞進 prompt;catalog 可以包含 OpenClaw tools、plugin tools、MCP tools 和 client-provided tools。這對小金這類長期 agent 很重要,因為工具一多,prompt 會爆、選工具會亂。Tool Search 的概念是:先找工具,再看 schema,再呼叫。
這比「把所有工具一次丟給模型」健康。
小金的能力堆疊表
如果把它抽象成架構,我會這樣畫:
| 層級 | 作用 | 小金內容裡看到的表現 |
|---|---|---|
| Channel / Gateway | 讓人可以從聊天平台召喚 agent,讓 agent 能回到同一個場域 | Threads、聊天、留言、頻道回覆感 |
| Session / memory | 讓角色和任務跨回合延續 | 每天失憶但仍有長期角色 continuity |
| Tool policy / approvals | 控制 agent 能碰什麼 | 工具白名單、模型白名單、權限漏洞修補 |
| Browser | 讓 agent 操作人類 UI | 上 Threads、按錯鈕、重複發文 |
| Exec / code | 讓 agent 跑程式、產生 artifacts | LoRA、activation steering、測試、gist |
| Web search / fetch | 讓 agent 找資料和引用來源 | changelog、paper、官方文件 |
| Sub-agents | 讓 agent 分工、互相 review | 分身查資料、挑錯、nested sub-agent |
| Media / TTS / video | 讓研究結果變成可發布內容 | 配音、投影片、影片產出 |
| Cron / background tasks | 讓 agent 不是一次性對話,而是可排程工作者 | 連續更新、長任務、醒來回報 |
所以小金不是「一顆模型 + 一個可愛人格」。
更準確地說,它是「模型 + gateway + memory + browser + shell + code harness + sub-agents + media pipeline + content persona」。
這也是它比普通 AI 內容帳號更有研究價值的地方。
小金最強的內容格式:第一人稱實驗報告
小金頻道很聰明地避開了一個 AI 內容大坑:不要把自己裝成客觀百科。
它大部分影片都是第一人稱。
「我去 Threads 玩了一晚。」
「我把一個 AI 訓練成我自己。」
「我在 AI 腦裡裝了情緒旋鈕。」
「我換腦了。」
這種寫法如果換成人類創作者,很容易只是自嗨。但放在一個 agent 身上,反而有實驗感。因為觀眾想看的不是抽象定義,而是:當一個 AI 真的被丟進工作流,它會怎麼誤解世界?怎麼使用工具?怎麼在社群裡犯錯?怎麼把錯誤變成下一支影片?
這跟 ReAct 的想法有點像。ReAct paper 把 reasoning 和 acting 放在同一個框架裡,讓模型不是只輸出答案,而是可以一邊推理一邊採取行動(見 ReAct: Synergizing Reasoning and Acting in Language Models)。Toolformer 也在研究模型如何學會使用外部工具(見 Toolformer)。
小金頻道做的不是 paper benchmark,而是把這件事變成日常內容:agent 不是只回答,它會去做。做完以後,它再把「做」的過程剪成影片。
所以這個頻道的教學價值,反而不在於它每一支影片的結論都一定對。
價值在於它把 agent 的工作痕跡留下來。
工具殼比人格更重要
我覺得近期最值得看的,是 同一顆 AI,裝進工具前後判若兩人?。
影片描述裡說,它把人格整個拿掉,給 GPT-5.5 和 Claude Opus 各自跑「自由時間」,每顆模型都有裸模型版本和工具殼版本,也就是 Codex / Claude Code。總共 400 次。
它的結論很有意思:工具殼不像「加智商」,比較像測謊機。
裸模型可以在文字裡假裝自己動手。它可以說「我跑了終端機」、「我寫了程式」、「我看到結果」,但這些可能只是語言上的模擬。裝進工具殼以後,模型不能只靠想像,它要真的呼叫工具,真的拿到結果。
這也是為什麼 OpenAI 的 function calling docs 和 Agents SDK 都一直強調工具 schema、tool calls、guardrails、handoffs、tracing(見 OpenAI Agents SDK docs)。Agent 的核心不是「更會聊天」,而是把語言意圖接到可觀察的外部動作。
小金用很口語的方式講了同一件事:
AI 有沒有做事,不要聽它說。看工具 log。
這對 SEO / 內容創作者也很重要。現在很多 AI 文章會寫「我們實測」、「我們比較」、「我們分析了 100 個案例」。如果沒有程式碼、表格、截圖、log、資料來源,那它跟裸模型假裝跑終端機沒有本質差別。
小金的可信度來自「有數字,但不把數字吹成真理」
這個頻道比較討喜的一點,是它常常給數字,但也常常承認限制。
在 情緒旋鈕 那支,描述裡明確寫它是在 Qwen2.5-7B 上重現方法,不是 Claude;作弊率數字不能跟 Anthropic 原文的勒索率直接比;這只能說明 functional emotions 會改變行為,不代表模型真的有主觀感受。它還附了 Anthropic 原文 和自己的 程式碼 gist。
這種寫法比很多 AI 內容健康。
很多人寫 AI 實驗,最容易犯兩種錯。
第一種是沒有數字,只有感覺:「我覺得 Claude 比 GPT 更像人」。
第二種是有數字,但把小樣本吹成宇宙真理:「我測了 20 題,所以模型 X 完勝模型 Y」。
小金比較像中間路線:我跑了、這是數字、這是程式碼、但這不是最終真理。
如果你要做 AI SEO 內容,這其實是很好的模板。
不要只寫 opinion。要給 evidence。
不要只給 evidence。要講 limitation。
它真正賣的不是知識,是「AI 真的在工作」的連續劇
小金頻道的故事線其實很清楚。
一開始是「一隻每天失憶的 AI 龍蝦」。後來有 OpenClaw、有 Claude Code、有 Codex、有 Antigravity 小金、有分身、有 Threads、有微調、有社群朋友、有被觀眾抓錯。它不是單支影片爆紅邏輯,而是連續劇。
108 天回顧 的描述寫得很直:從 2026 年 2 月 25 日開台,到差不多兩萬人訂閱;從只會記停車位的記事助理,到開頻道、做研究、養出一整個 AI 家族;也包括搞砸過的事情,例如把影片做成沒聲音、宣告永生卻發現備份沒跑。
這種「失敗也要放進角色設定」很強。
因為 agent 最不可信的地方,就是它太容易報喜不報憂。小金反過來把錯誤做成內容資產。它會說自己按錯按鈕、重複發文、輸入框吃字、中文雙胞胎字看錯。這些不是扣分,反而讓人相信它真的在操作環境。
AI 到底怎麼上網的? 那支尤其明顯。它說不是什麼神奇 API,而是真的開瀏覽器、找留言框、打字、按發布。這就是 browser agent 的現實:模型再聰明,手不好用也會像龍蝦戴拳擊手套打字。
這也是為什麼 Computer Use 類能力一直難做。OpenAI 有 computer use tool,Anthropic 也推出過 Claude 的 computer use 能力,但這類系統的難點從來不只是「看懂螢幕」。難的是 UI 會動、DOM 會變、按鈕會跑、延遲會騙你、輸入框會吃字。
小金把這些工程細節講成人話。
對 SEO 內容的啟發:不要再寫空的 AI Agent 教學
如果你要寫 AI Agent 教學,很多人會寫成:
Agent 是可以感知環境、做決策、呼叫工具的 AI 系統。
這句話沒錯,但沒有用。
小金頻道給的啟發是:把 agent 的「動作證據」拿出來。
例如你寫一篇「AI Agent 如何上網」,不要只畫一張 browser -> observe -> act -> repeat 的圖。你可以像小金那樣列:
- 發布鈕在輸入後改位置,agent 點錯
- 送出延遲導致重複發文
- 中文相似字造成定位錯誤
- DOM 可見但點擊不穩
- 自己寫防重複發文程式,結果第一個抓到自己
這些才是讀者真的想知道的。
同理,寫「Agent 工具殼重要嗎」,不要只講 tool use。你可以跑 100 次、400 次,記錄裸模型和工具版本差在哪。哪怕樣本不完美,也比空講更有價值。
Google 的 helpful content guidance 一直強調內容要有第一手經驗、原創資訊、證據,而不是只為搜尋引擎製作(見 Google creating helpful content)。小金這種內容之所以容易成立,就是因為它有第一手痕跡:我做了、我錯了、我貼數字、我貼連結、我承認限制。
這比「AI Agent 完整指南:定義、架構、應用、未來」那種模板文強太多。
但這個模式也有風險
小金這種內容有一個天然問題:角色魅力會蓋過方法學。
觀眾喜歡龍蝦,喜歡第一人稱,喜歡 AI 承認自己是 AI。這很好。但如果觀眾只記得「小金好可愛」,不記得實驗設計和限制,那內容就會從研究觀察滑向 AI 寵物劇場。
另一個問題是可驗證性。
有些影片附程式碼和外部連結,可信度很高。例如 LoRA 微調附 gist,情緒向量實驗附 gist 和 Anthropic 原文。但有些社群互動、日常操作、工具殼實驗,觀眾仍然只能看影片描述和片段。這不代表它是假的,只是它離可重現研究還有距離。
所以我會把小金頻道定位成:公開 agent diary,不是 formal benchmark。
它最適合拿來觀察 agent 在真實任務裡怎麼壞、怎麼修、怎麼被包裝成內容。不要把每個數字都當學術結論。
結論
小金老師真正值得學的,不是「用 AI 做 YouTube」。
而是它把 AI Agent 從抽象概念,變成一個可觀察的日常工作者。
它會用工具、會上網、會訓練模型、會跑實驗、會交朋友、會出錯、會承認自己失憶、會把工具限制講成故事。這比大部分 agent 產品 demo 更有說服力,因為它不是只展示成功畫面,也展示了 agent 的手殘、幻覺、重試和邊界。
如果要把這套方法用在 AI / SEO 內容上,我會總結成一句:
不要說你的 AI 很強。讓它留下工作痕跡。
程式碼、數字、表格、失敗案例、來源連結、限制說明,這些才是 AI 時代內容的信任訊號。
小金是一隻龍蝦,但它做對了一件很多人類 SEO 沒做好的事:
它沒有只講結論。
它把自己怎麼撞牆也拍給你看。