Theo 本來要測 Matt Pocock 的 skills。影片開場稱這套 Markdown 檔案已累積超過 20 萬顆 GitHub stars,當時的官方縮圖則顯示 51 個 skills、1,650 萬次安裝。真正的主題不是哪個 repo 最大,而是這些短短的檔案進到 agent context 後,究竟能不能改變實際工作結果。
他先讓 agent 讀自己幾台機器上的工作紀錄,再替 Matt 的 repo 與 Cursor 裡 Lauren Tan 製作的 pstack skills 按適合程度排序。想試純文字 skill 時,他甚至不先安裝,只把 `SKILL.md` 貼進新對話看實際反應。Theo 的第一個結論不是「全部裝起來」,而是不要盲目照抄別人的設定:先看內容、拿來測,再只留下適合自己工作的部分。
最明顯的變化來自 pstack 的 `unslop`。它要求 agent 刪掉空泛包裝、宣傳語氣與制式聊天句,直接寫清楚做了什麼;其中一條判準是「說明它做了什麼,不要只寫它給人的感覺」。Theo 用同一個模型比較後,套用 skill 的版本能直接交代 T3 Code 是什麼、怎麼使用與適合誰,未套用的版本則又長又繞。比起把整套流程照單全收,他最後更偏好 pstack 的寫法與日常適用性。
來源:影片畫面擷取自 YouTube/Theo - t3․gg(約 11:40)
Matt 的 skills 也有真正留下來的東西。`grill-me` 與 `grill-with-docs` 會持續追問一個計畫,把產品對象、下一步、技術邊界與不可逆操作逐項逼清楚,必要時同步整理成決策文件。Theo 把它貼進 T3 Code,讓 agent 追問 Lakebed 的主要使用者、誰付錢、下一個目標,以及一個 capsule 到底能容納多少功能;問題多到讓他不想回答,卻也逼他做出原本一直迴避的選擇。錄影後,他在置頂留言補充,自己仍然每天使用 grill skill,而且 Matt 已移除影片裡被他嫌到不行的 em dashes。
來源:影片畫面擷取自 YouTube/Theo - t3․gg(約 17:48)
留言區最直接的玩笑是:「說要 review Matt 的 skills,結果一直在 review pstack。」另一群人則忙著替 em dash 辯護。也有使用者肯定 grill、Wayfinder 與 pstack 的實際效果;相反意見則質疑,一個缺乏可量測評估與 QA 的專案,即使累積 20 萬顆 stars,也不代表每個 skill 都可靠。影片最後留下的判準因此不是照排行榜安裝,而是讀過內容、實際測試,再依自己的工作方式修改工具箱。
So I tried Matt's skills... / Theo - t3․gg · 在 YouTube 觀看 ↗