2023 年前後有一段時間,提示詞工程感覺像煉金術。你找到對的咒語——那句魔法短語、指令的完美排序——一個原本只會吐爛泥的模型就突然產出黃金。COSTAR 這類框架正是在那個世界裡誕生的。Sheila Teo 的 COSTAR(Context、Objective、Style、Tone、Audience、Response)贏得了新加坡第一屆 GPT-4 提示詞工程競賽,而且贏得有道理:它為一個原本像不斷試錯的流程建立了秩序。
三年後,這些框架還在。COSTAR 仍然是最廣為傳授的結構之一。但它們有效的原因已經悄悄改變了,如果你還把它們當成效能外掛在用,你解決的是一個大致上已經不存在的問題。
這些框架當年真正在做什麼
結構化提示最初的賣點是解鎖能力。早期模型需要你把話講白。不宣告受眾,就得到通用的輸出。不指定格式,就得到一整面文字牆。COSTAR 的六個欄位,剛好對應 2023 年代模型會猜錯的六件事。
這讓結構顯得承重。拿掉「Audience」欄位,輸出就明顯變差。於是大家內化了一條規則:結構越多,輸出越好。以當時的證據來看,很合理。
什麼變了
2026 年的前沿模型自己就能推斷出大部分的鷹架。叫一個有能力的模型「寫一封禮貌的拒絕信給廠商」,它已經會挑一個合理的文風、恰當的語氣和乾淨的格式——不用你點名任何一項。你以前手動填的欄位,現在由模型自己的判斷填上了。
這不代表 COSTAR 錯了。而是對有能力的模型處理直白任務時,它的一部分變得多餘。當模型本來就會選「專業」的時候,宣告「Tone: professional」的邊際價值已經趨近於零。對一個簡單請求套上僵硬的六段式鷹架,如今大多只是儀式——花了力氣卻推不動輸出。
有趣的皺褶在這裡:這件事是看模型的。最近一篇關於 COSTAR-A 的論文發現,原始框架對大型模型仍能提升清晰度,但在較小、經過本地優化的模型上表現較不穩定——尤其是需要受限、指令式輸出的任務。如果你在自己的硬體上跑一個 8B 級微調模型,舊規則大致仍然適用,你甚至可能需要比 COSTAR 更指令式的結構。「框架已經過時」的說法,其實是「前沿模型變強了」的說法,而它並不能乾淨地套用到小模型的世界。
仍然值回票價的部分
留下來的是這個,也是值得保留的部分:框架是一份防止遺忘的檢查清單。
2026 年結構化提示之所以打贏偷懶的提示,通常不是結構本身,而是逐格檢查會逼你補上那些真正仍然影響品質的東西——它們集中在三個地方:
- 脈絡(Context)——槓桿最高的單一輸入。大多數爛輸出追根究柢是缺脈絡,不是缺結構。模型無法推斷你從未告訴它的事。
- 目標(Objective)——一個具體明確的任務,而不是模糊地比劃一下。
- 回應格式(Response)——輸出的形狀。強制一個可解析、可預測的結構,才能讓提示詞安全地跑在 pipeline 裡。
Style、Tone、Audience 仍然重要,但要看場合。在面向客戶、講究品牌語氣的工作裡,它們有一席之地——文字必須大規模地聽起來是某種樣子。但對程式碼審查或技術分析,它們大多是雜訊——一個在審你 auth handler 的模型不需要語氣指令。
所以正確的心智模型不是「每次把六個格子都填滿」,而是「把格子當備忘錄,然後大刀闊斧地修剪」。留下對你的任務承重的部分,其餘丟掉。
一份你真的會用的範本
這是把 COSTAR 當工作檢查清單、而非必填表格的樣子。注意有多少被標成可省略:
/* ============================================================
* TL;DR: COSTAR as a checklist, not an incantation.
* On capable 2026 models, Context + Objective + Response do
* most of the work. Style/Tone/Audience matter for prose at
* scale, less for code. Keep what's load-bearing, cut the rest.
* ============================================================ */
# CONTEXT — highest leverage; never skip
You are reviewing a Hono route handler in a TypeScript monorepo
on Cloudflare Workers + Supabase.
# OBJECTIVE — be specific and concrete
Find auth-bypass risks in this handler and list each one.
# STYLE — often inferable for technical work; drop if obvious
Terse, senior-engineer register.
# TONE — usually noise for code; matters for user-facing copy
(omit)
# AUDIENCE — shapes assumed knowledge and depth
A backend dev who already knows JWT and RLS.
# RESPONSE — high leverage; forces predictable, parseable output
Markdown list: finding -> severity -> one-line fix. No preamble.
結構仍然完勝的地方
有一個場景,這種檢查清單的紀律不是可有可無:寫一次、跑很多次的提示詞。系統提示、自動化流程、RAG pipeline——任何你無法逐次迭代的地方。互動式聊天允許你丟一個亂七八糟的請求給模型,它會錯意時再修正。Pipeline 不行。當提示詞必須在數千筆輸入上第一次就正確時,框架強制的完整性就不再是儀式,而是保險。
誠實的結論
COSTAR 和它的親戚們沒有變爛。它們是被降級了——從咒語降為紀律。它們不再解鎖模型原本達不到的能力。它們仍然做到的,是逼你寫出一份完整的提示詞,而完整的提示詞會產出更好的結果,無論你是靠哪個縮寫走到那裡的。
把框架當成你思考的鷹架,而不是對模型施展的魔法短語。填上對眼前任務有分量的格子,砍掉沒有的,然後把省下的力氣花在那個沒有任何框架能替你補上的輸入上:模型無從得知的脈絡。