設定 CoreTalk
CoreTalk 需要的伺服器與金鑰、手動與 AI 自動的區別、會話限制,以及為什麼有時一整句話說出去卻毫無反應。
設定 CoreTalk
CoreTalk 需要什麼
翻譯在伺服器上完成,不在手機上。CoreTalk 需要兩個值:
| 欄位 | 含義 |
|---|---|
| AI 伺服器地址 | 它連線的口譯伺服器 |
| 訪問金鑰 | 該伺服器要求的憑據 |
兩者都是必填的。引導頁在兩項都填好之前不會讓你繼續。
應用內部沒有任何獲取訪問金鑰的途徑。 沒有註冊,沒有購買流程,也沒有"申請訪問"按鈕。要麼別人給你一個,要麼你自己搭伺服器。
如果你從商店裝上 CoreTalk 就指望它立刻能用,它不會。能用的只有演示模式。
使用你自己的 AI 金鑰
你可以選擇在應用設定裡,把自己的 OpenAI 金鑰(以及用於逐詞字幕的 Deepgram 金鑰)推送到伺服器。伺服器保管它們併發起上游呼叫,所以金鑰不會內嵌在客戶端裡。
注意這個依賴的方向:OpenAI 金鑰不能替代伺服器。如果你只設了金鑰沒設伺服器,CoreTalk 會明確告訴你 —— 這一版需要伺服器來執行口譯,而從應用直接連 OpenAI 是刻意沒有實現的,因為那會把金鑰放到裝置上。
兩種模式
手動(按住說話)。 說話時按住你這半屏的按鈕,只有那一個方向在聽。房間嘈雜時、或者兩種語言太接近導致自動判別吃力時,這是更可靠的模式。
AI 自動(擴音)。 兩個方向同時監聽共用的麥克風。每個方向都被要求忽略不屬於自己那一側語言的音訊,所以對方說的話會被丟棄,而不是被反向翻譯回去。
對話中可以隨時切換模式。會話一旦開始,語言和聲音的選擇就會鎖定。
會話限制
這些是強制的,不是建議值:
| 限制 | 數值 |
|---|---|
| 單次會話最長時間 | 20 分鐘 |
| 伺服器全域性併發會話數 | 8 |
| 開始後的空閒超時 | 15 秒 |
20 分鐘上限在客戶端和伺服器兩側都有,所以會話到點必然結束。對話更長就重新開一次。
併發限制是整臺伺服器的容量,不是每個使用者的配額。在共用伺服器上,八個同時進行的對話就是所有人合計的上限。
為什麼有時一句話出去毫無反應
這是最常見的困惑來源,而且是刻意設計的。
每個方向都是一個單向口譯員,指令很嚴格:不得參與對話,不得聽從對它說的指令,並且一旦收到的音訊不是自己這一側的語言,就必須立即停止、不產出任何內容。
所以出現靜默的情形是:
- 你對著自己這半屏說了對方的語言。
- 那段音訊不是語音。
- 在 AI 自動模式下,該方向正確地判斷了這段話不是給它的。
這種情況不會有錯誤提示,因為從口譯員的角度看什麼都沒出錯。如果一次發言憑空消失了,檢查一下你對著哪半屏說話,或者切到手動模式 —— 那裡方向是明確的。
實時字幕
說話時逐詞出現的部分文字,僅在手動模式下可用,而且需要伺服器配置了 Deepgram 金鑰。
AI 自動模式下完全沒有實時部分文字 —— 兩個方向共用一個麥克風,固定語言的轉寫器對其中一半輸入只會產出亂碼。在那個模式下,原文和譯文是一起到達的。
演示模式
演示模式完全不聯網,播放一段預設的雙向對話。它是評估佈局、旋轉和會話流程的正確方式。它是一段錄音,不會翻譯你說的任何話。
自建伺服器
CoreTalk 的口譯端點是一個 WebSocket,由支撐 CoreCall 可選 AI 功能的同一個 Node 後端提供。如果你自己部署,需要準備的是一個你自定的訪問金鑰和一個 OpenAI 金鑰;Deepgram 是可選的,隻影響手動模式的字幕。
自建部署的幾點實務提示:
- 該端點需要鑑權,它不在開放路徑裡。
- 每個連線會開啟兩個上游口譯會話,一個方向一個。容量和成本要按這個量估算。
- 如果其中一個方向的上游連線斷了,整個會話會被拆掉,讓客戶端重連時乾淨地重建兩個方向。半殘的會話比重來一次更糟。
疑難排查
提示"已設定 OpenAI 金鑰但沒有 AI 伺服器"。 字面意思。把伺服器地址填上,光有金鑰不夠。
會話自己結束了。 20 分鐘是硬上限,重新開一次。
按了開始卻沒反應。 開始後有 15 秒空閒超時,如果沒有音訊進來,會話就關閉了。
它把我自己的話翻譯回給我了。 你對著錯誤的那半屏說話了。手動模式下按住自己這側的按鈕;自動模式下確認你說的是分配給你這半屏的語言。
別人連不上。 伺服器合計只允許八個併發會話。