過去使用語音 AI,對話很容易出現一種明顯的機器感:使用者說完一句話,等待系統判斷「這一輪結束了」,AI 才開始處理並回答。
GPT-Live 改變的核心,就在這個互動方式。
OpenAI 將 GPT-Live 定位為新一代語音模型,目前已用於 ChatGPT Voice。GPT-Live 採用 full-duplex 全雙工架構,可以同時聆聽與說話,因此能在使用者停頓、插話、改變語速或需要思考時,更自然地決定要繼續聽、暫停或回應。
對企業而言,GPT-Live 值得注意的地方也不只在「語音更像真人」。OpenAI 已經開始讓 Voice 和搜尋、記憶、文件、Projects、Work 與 Codex 等能力結合,語音正在從單純聊天入口,逐漸延伸成可以協調工作與取得資訊的操作方式。
GPT-Live 是什麼?
GPT-Live 是 OpenAI 為即時語音互動設計的新一代模型家族。
目前 ChatGPT Voice 的 Live 體驗,付費方案使用 GPT-Live-1,Free 使用 GPT-Live-1 mini;實際可以看到哪些 Voice 選項,仍會受到方案、工作區設定、地區與 App 版本影響。
和過去逐輪處理語音的方式相比,GPT-Live 主要有兩項變化。
可以同時聽與說
傳統語音 AI 往往需要先判定使用者已經說完,再開始回答。
GPT-Live 會持續處理語音輸入,也能同時產生語音輸出,因此可以:
- 接受自然插話
- 判斷停頓是不是正在思考
- 在需要時繼續聽
- 依照對話節奏快速回應
- 在背景有其他工作進行時維持對話
OpenAI 將這種架構稱為 full-duplex,目的是減少傳統「一人說完、換另一人說」的僵硬感。
複雜工作可以交給其他模型處理
GPT-Live 本身主要維持快速、自然的語音互動。
當問題涉及搜尋、更深入推理或較複雜工作時,系統可以把任務委派給其他前沿模型處理,再把結果帶回語音對話。OpenAI 在 GPT-Live 發布時說明,初期背景會使用 GPT-5.5,未來可隨前沿模型更新而調整。
這代表「說話」和「深入思考」開始被拆成不同工作。
使用者可以繼續和 Voice 對話,同時讓背景模型搜尋或推理,不一定需要等待整個工作完成才繼續交流。
GPT-Live、Advanced、Standard Voice 與 Dictation 差在哪?
目前 ChatGPT Voice 不只有一種語音使用方式。
| 功能 | 核心用途 | 互動方式 | 適合情境 |
|---|---|---|---|
| Live | 自然即時語音對話 | 可同時聽與說、支援自然插話 | 討論、發想、語音問答、即時工作協調 |
| Advanced | 前一代即時 Voice 體驗 | 即時語音互動 | 目前仍需要支援的行動版影片或螢幕分享情境 |
| Standard | 一般逐輪語音 | 先辨識語音,再產生回答 | 對自然對話要求較低的一般語音使用 |
| Dictation | 將單次錄音轉成文字 | 說完後產生可編輯文字 | 輸入口述 Prompt、整理一段語音成文字 |
OpenAI 目前將 Live 定義為最新的 Voice 體驗,Advanced 則保留給部分仍需要影片或螢幕分享的情境;Standard 是較傳統的逐輪模式。若單純需要把一段口述內容轉成可以修改的文字,官方建議使用 Dictation。
這四者最大的差別,可以簡單理解為:
Dictation 是「用聲音輸入文字」,Live 則是「直接和 AI 持續交談」。
GPT-Live 在 ChatGPT Voice 中可以做什麼?
目前官方已確認的 ChatGPT Voice Live 能力包括:
- 即時語音對話
- 自然插話與停頓
- 使用 Web Search
- 使用 Memory
- 顯示支援的視覺結果
- 在同一對話中搭配文字與圖片
- 使用檔案
- 使用 Projects 中的聊天、來源與專案指令
這讓 Voice 的用途逐漸超過「跟 AI 聊天」。
例如一位主管可以在 Project 中放入:
- 專案文件
- 過去討論
- 研究資料
- 工作指令
之後直接用語音詢問:
這個專案目前卡在哪裡?
或:
幫我整理明天會議最需要確認的三個問題。
截至 2026 年 8 月 7 日,OpenAI 已進一步讓 GPT-Live Voice 支援檔案上傳與 Projects,因此可以在語音對話中詢問檔案內容,或利用 Project 中既有的脈絡進行對話。
GPT-Live 對企業工作可能帶來哪些改變?
會議前準備可以從「打字查資料」變成「直接討論」
例如主管準備參加客戶會議,可以用 Voice 詢問:
- 客戶過去有哪些需求?
- 這次會議需要先確認什麼?
- 哪些數字容易被問到?
- 我應該準備哪些反對意見?
- 幫我模擬客戶可能會問的問題。
若相關資料已經放在 Project 或檔案中,Voice 可以直接根據這些脈絡協助討論。
從企業流程角度觀察,這類應用特別適合「需要思考,但不方便一直操作鍵盤」的工作。
訪談前可以模擬問答與追問
訪談、Podcast、業務訪談或顧客研究常常需要臨場追問。
GPT-Live 的自然插話與停頓能力,適合延伸用於:
- 訪談問題演練
- 模擬受訪者回答
- 練習追問
- 檢查問題是否過長
- 模擬客戶異議
- 練習簡報問答
例如可以要求:
請模擬一位第一次導入 AI 的中小企業老闆,我要訪問你。每次回答不要太完整,讓我練習追問。
這屬於工作應用建議,並非 OpenAI 對訪談成效的官方承諾。
需要注意的是,ChatGPT Voice 的 transcript 並非逐字紀錄,官方提醒語音轉錄內容可能與實際說法存在差異。若目的是建立正式逐字稿,不應直接將 Voice 對話紀錄當成完整錄音轉錄。
客服的第一個應用可以先放在「內部訓練」
語音 AI 很容易讓企業直接想到自動客服。
但對多數中小企業來說,比較穩健的第一步可以是:
- 模擬客戶提問
- 新人客服訓練
- FAQ 口語演練
- 練習客訴回應
- 商品與服務介紹
- 客戶需求釐清訓練
OpenAI 已將 GPT-Live 評估在多輪電信客服型任務中,但單一官方評測不能直接轉換成「企業導入後一定提升客服效率」的商業成效。
真正要對外建立自動語音客服時,還需要另外考慮:
- 電話系統
- 客戶身份確認
- CRM
- 個資與錄音
- 轉真人條件
- 客訴處理
- 系統錯誤
- 服務時間
- 人工接手機制
這已經是完整的語音 Agent 系統設計,不只是開啟 ChatGPT Voice。
Voice 現在也能進入 Work 與 Codex
GPT-Live 的企業價值目前有一個很重要的延伸:Voice 已開始進入 Work 與 Codex。
在符合資格的 ChatGPT 桌面版中,使用者可以直接對 Work 或 Codex 說話、自然插話,並要求 Voice 啟動或協調任務。Voice 會使用目前 Work 或 Codex 已經具備的工具與權限。
例如在 Work 中,可以說:
幫我讀這些檔案,整理成一份市場研究,先告訴我你準備怎麼做。
在 Codex 中則可能是:
先檢查這個專案為什麼測試失敗,不要修改正式環境。
Voice 此時負責「溝通與協調」,實際任務仍由所選的 Work 或 Codex 工作環境執行。
企業任務選擇表
以下為康思迅從企業工作流程提出的應用建議。
| 企業任務 | 是否適合評估 GPT-Live | 建議使用方式 | 人工確認程度 |
|---|---|---|---|
| 會議前資料準備 | 高 | 根據檔案與 Project 進行語音問答 | 中至高 |
| 腦力激盪 | 高 | 直接進行快速來回討論 | 中 |
| 簡報問答演練 | 高 | 模擬主管或客戶提問 | 高 |
| 訪談問題演練 | 高 | 模擬受訪者並練習追問 | 中 |
| 新人客服訓練 | 高 | 模擬常見客戶情境 | 高 |
| 內部 SOP 問答 | 中至高 | 搭配專案檔案進行語音詢問 | 高 |
| Work 任務協調 | 高 | 用 Voice 啟動、詢問與追蹤工作 | 高 |
| Codex 技術工作協調 | 中至高 | 用 Voice 說明需求,再由技術人員審核 | 極高 |
| 正式會議逐字稿 | 不建議直接依賴 | Voice transcript 僅作參考 | 極高 |
| 自動對外客服 | 需另外系統設計 | 應先評估 API、CRM、權限與轉真人流程 | 極高 |
| 法律、醫療、財務語音建議 | 僅作輔助 | 必須交由合格專業人員判斷 | 極高 |
GPT-Live 可以直接當會議錄音工具嗎?
如果目標是「一邊開會,一邊讓 AI 參與討論」,Voice 具有應用空間。
但如果目標是:
完整記錄所有人逐字發言。
就需要特別小心。
OpenAI 官方明確說明,Voice transcript 並不是逐字紀錄,內容可能與實際說出的話不同。
因此,正式會議紀錄仍應:
- 保留原始錄音或正式紀錄來源。
- 使用適合的轉錄工具產生文字。
- 由 AI 整理摘要、決議及待辦。
- 由與會人員確認人名、期限和責任。
GPT-Live 比較適合成為「對話與工作助手」,而不是唯一的會議證據來源。
GPT-Live 可以讀文件嗎?
可以,但需要區分目前產品能力。
ChatGPT Voice 已支援在語音對話中上傳檔案並詢問內容,也可以在 Projects 裡使用語音,參考近期聊天、來源與專案指令。
這讓語音工作可以形成:
檔案 → Project → Voice 討論 → 後續工作
例如:
我剛上傳這份客戶月報,請先告訴我數據裡最需要注意的三個變化。
或:
根據這份提案,模擬客戶在會議上可能提出的問題。
這類情境比純語音聊天更接近企業真正的日常工作。
GPT-Live 的限制與注意事項
功能會依方案、工作區與平台不同
Voice 中能看到 Live、Advanced 或 Standard 哪些選項,會依方案、工作區設定、地區與 App 版本而不同。
因此本文不自行列出固定使用額度,也不判定特定台灣帳戶一定具有哪一項功能。
Live 與 Advanced 的功能仍不完全相同
OpenAI Help Center 目前說明,Live 一開始不支援影片、螢幕分享、Connected Apps 或 Plugins;若需要支援的行動版影片與螢幕分享功能,可使用 Advanced。
另一方面,在 ChatGPT 桌面版的 Work 與 Codex 中,Voice 可以利用該工作環境已經具備的工具與權限協調任務。
因此,「一般 Chat 的 Live」和「Voice in Work/Codex」不能完全視為同一種工具權限。
AI 語音回答仍可能出錯
OpenAI 在 Voice Help Center 直接提醒 ChatGPT 可能犯錯,特別是涉及日期、時間或地點等資訊時需要再次確認。
企業若使用 Voice 處理:
- 報價
- 合約
- 客戶承諾
- 法規
- 財務
- 醫療
- 正式數據
仍應回到原始資料確認。
GPT-Live 產生的部分音訊已有來源標記
OpenAI 在 2026 年 7 月 31 日更新 GPT-Live,表示透過 ChatGPT Voice 和 OpenAI API 產生的受支援音訊現在加入 SynthID 浮水印,也提供來源驗證能力。
這代表 OpenAI 正在增加 AI 音訊的來源識別機制,但企業仍應自行管理語音內容、權限與使用情境。
GPT-Live 和 max、ultra 有什麼關係?
這幾個名詞屬於不同層級。
| 名稱 | 類型 | 主要用途 |
|---|---|---|
| GPT-Live | 語音模型/語音互動系統 | 即時聆聽、說話及語音工作協調 |
| Instant/Medium/High | Voice 中可使用的推理投入選項 | 依問題複雜度調整背景推理 |
| max | GPT-5.6 在 Work/Codex 的推理設定 | 增加困難任務的推理投入 |
| ultra | Work/Codex 的多代理執行設定 | 平行協調複雜工作 |
OpenAI 對 GPT-Live 的官方說明中,Voice 可以選擇 Instant、Medium 與 High 等不同推理程度;GPT-Live 也可以把更深的工作交由背景前沿模型處理。
max 與 ultra 則屬於先前 GPT-5.6 Work/Codex 的工作設定,不能直接當成 GPT-Live 的語音模式。
因此,如果使用 Voice 控制 Work 或 Codex,應分開理解:
Voice 負責你怎麼和系統溝通;Work/Codex 的模型與推理設定,負責任務實際如何執行。
實際可用選項仍應以目前帳戶與工作區介面為準。
康思迅觀點:語音 AI 的價值在於降低「操作成本」
企業討論 AI 時,通常會注意模型回答得準不準、文章寫得好不好。
GPT-Live 帶來另一個值得觀察的方向:
人可能不再需要一直停下手上的工作,切換視窗、找資料、輸入 Prompt,才能使用 AI。
例如行銷主管可以一邊看月報,一邊詢問:
這組數字和上個月差多少?
業務在準備簡報時可以說:
幫我模擬客戶可能問的問題。
技術主管則可以直接要求 Codex:
先查問題,不要改正式程式。
從企業工作流程角度來看,語音真正可能降低的,是人和系統互動時的操作摩擦。
但我們不建議一開始就把 GPT-Live 放進對外自動客服。
較適合的順序是:
內部語音問答 → 會議與簡報演練 → 文件語音查詢 → Work/Codex 協調 → 再評估對外客服。
如此可以先建立資料、權限與人工審核方式,再逐步擴大使用範圍。
FAQ
GPT-Live 和 ChatGPT Voice 是同一個東西嗎?
GPT-Live 是提供新一代語音互動能力的模型與系統;ChatGPT Voice 則是使用者實際操作的語音產品體驗。目前 ChatGPT Voice 的 Live 模式由 GPT-Live 提供核心能力。
GPT-Live 最大的不同是什麼?
GPT-Live 採用 full-duplex 架構,可以同時聆聽與說話,更自然地處理插話、停頓和對話節奏。需要搜尋或較深推理時,也能把工作交給其他前沿模型處理。
GPT-Live 可以讀 PDF 或其他檔案嗎?
目前 ChatGPT Voice 的 GPT-Live 已支援檔案上傳,也能在 Projects 中使用專案聊天、來源及指令作為語音對話脈絡。實際可用功能仍取決於帳戶、工作區與平台。
GPT-Live 適合做客服嗎?
可以用於客服問答演練、新人訓練及內部知識查詢。若要建立真正面向客戶的自動語音客服,還需要處理電話系統、資料權限、CRM、客戶識別及轉真人等系統設計,不能只把 ChatGPT Voice 直接視為完整客服系統。
GPT-Live 可以完全取代真人會議或客服嗎?
OpenAI 並沒有承諾 GPT-Live 可以取代真人會議、客服或專業人員。Voice 回答仍可能出錯,語音 transcript 也不是逐字紀錄,因此涉及正式紀錄、客戶承諾與高風險資訊時,仍需要人工確認。
先從內部語音工作開始測試
GPT-Live 讓 ChatGPT Voice 從「可以用語音聊天」,開始延伸到文件、Project、Work 與 Codex 等工作情境。
企業不一定需要第一步就打造 AI 客服。
可以先從:
- 會議準備
- 客戶訪談演練
- 簡報問答
- 內部知識查詢
- 文件語音問答
- Work 任務協調
- 技術工作溝通
建立一套容易驗收、風險較低的語音 AI 使用方式。
康思迅數位可協助企業盤點行政、行銷、SEO、廣告月報、網站與客戶服務流程,找出適合使用 Chat、Work、Codex 與 Voice 的工作節點,建立資料來源、AI 分工、權限與人工審核機制。
資料來源
- OpenAI:Introducing GPT-Live,GPT-Live 的 full-duplex 架構、背景模型委派、ChatGPT Voice 應用及 SynthID 更新。
- OpenAI Deployment Safety Hub:GPT-Live System Card,GPT-Live-1、GPT-Live-1 mini 的定位、全雙工互動與安全設計。
- OpenAI Help Center:ChatGPT Voice,Live、Advanced、Standard、Dictation、方案/工作區差異與 Voice 限制。
- OpenAI Help Center:ChatGPT Release Notes,GPT-Live 在 ChatGPT Voice、檔案、Projects 與 Work/Codex 中的近期更新。
- OpenAI Help Center:ChatGPT Work and Codex,Voice 在桌面版 Work 與 Codex 中協調任務的方式。
- 已上傳查證資料包中的保守查核原則:未確認資訊不得補寫、功能狀態與方案應在發布前重新確認。



