One pattern I find useful for working with LLMs is a nice long ramble session. Sometimes the LLM needs more bits to understand what you're trying to achieve, but you're too lazy to type them. In these cases I like to lean back, switch to /voice and just ramble for like 10…
Andrej Karpathy 公開大神 Prompt 心法:開語音跟 AI 狂聊 10 分鐘
OpenAI 創始成員、現任 Anthropic 預訓練團隊成員 Andrej Karpathy 週二(7/21)在 X 上公開自己跟 LLM 協作的固定套路,遇到複雜任務時他不打字,直接切到語音輸入連講 10 分鐘,內容可以跳躍、混亂、毫無章法。他的觀察是模型很擅長從語無倫次的長篇裡還原你真正想做的事,吐回來的版本通常比你自己講的還乾淨。
(前情提要:OpenAI 創始成員 Andrej Karpathy 宣布加入 Anthropic:重返 LLM 研發最前線)
(背景補充:Andrej Karpathy 提煉「CLAUDE.md 四大準則」引爆 GitHub,讓 AI 寫 Code 準確率飆破 90%)
懶得打字,就用講的。Andrej Karpathy 週二(7/21)在 X 上寫下自己跟 LLM 協作的一個固定套路,需要交代的背景太多、手指卻跟不上腦袋的時候,他會往椅背一靠,切到 /voice 語音輸入,然後連續講 10 分鐘。「完全一團亂,什麼都可以講,全程意識流。」
有時候他會先跟模型打聲招呼,在開頭補一句「切換成語音辨識了,錯字先說聲抱歉」;有時候他乾脆把這段獨白變成一場小型訪談,讓模型反過來追問幾輪,把散落的線索一條一條挖出來。
語音輸入本身不是新東西,Karpathy 真正在講的是輸入量。與其花力氣把想法整理成一段乾淨的指令,不如把整包想法直接丟過去,讓模型自己拆開來重組。
前期多講一點,後面少改一點
他給的理由很直接。「LLM 不知為何非常擅長重建冗長而語無倫次的獨白,它們迴音給你的那份,往往比你原本那團思緒還乾淨得多。」他寫道,結果是 mind meld(心靈融合,指人跟模型對彼此意圖的理解逐漸對齊)改善了,從那個時間點之後,需要回頭糾正的地方反而更少。
這句話點出這套方法真正的成本結構。大部分人省了前期打字的力氣,代價是後面反覆修正、來回丟訊息澄清自己的意思;Karpathy 的做法是把成本全部押在前面那 10 分鐘,用一次超大量的背景資訊交代,換掉後面五輪的「不是這個意思」。
反對的人都擔心同一件事
X 回覆區大致分成兩派。支援的人說這套已經佔掉自己八成的 prompt,也有人形容改以語音為主之後產出效率翻了 5 到 8 倍,多語使用者則喜歡它不挑語言。
反對的聲音則集中在同一個顧慮,把「把話講清楚」這件事整個外包給模型,長期下來自己的組織能力跟寫作能力會不會退化。有人給出折衷做法,模型整理完之後自己再手動蒸餾一次,不要照單全收。
兩邊其實沒有誰對誰錯,Karpathy 的用法是把模型當成會整理的鏡子,不是代筆,差別只在你有沒有把它整理出來的版本讀回去。