AI・業界
翻譯產出成本與品質保證成本
翻譯曾經是一件耗時且細緻的工作。譯者讀原文,遇到不懂的地方查資料、上網搜尋,對照字典斟酌用語,再一句一句把譯文寫出來。
現在呢?把文章貼進生成式 AI 或機器翻譯,幾秒鐘譯文就出來了。親眼看過這種速度,會覺得「已經不需要譯者了」「翻譯應該不用花什麼錢」,其實一點也不奇怪。
AI 確實大幅降低了產出譯文所需的時間與成本。想快速掌握資訊大意、讀一封外文信件、在公司內部分享內容——這類用途下,AI 的譯文常常不必經過人工確認就能直接用。
但如果譯文要作為具備一定品質的成果交付給第三方,情況就不一樣了。把譯文做出來只是其中一部分;還得有人確認這份譯文是否正確傳達了原文的內容。
這篇文章就把翻譯拆成「產出」與「品質保證」兩個部分,來談談 AI 改變了什麼,又有哪些工作留了下來。
譯文品質確實大幅進步
機器翻譯的譯文比從前自然、易讀,這一點應該沒什麼爭議。
關鍵的轉捩點出現在 2016 年前後,神經機器翻譯開始普及。Google 在 2016 年發表的神經機器翻譯系統(GNMT)論文中提到,在以簡單獨立句進行的人工評估裡,GNMT 的翻譯錯誤比先前的片語式系統平均少了 60%。
這項評估的條件有限,但足以說明神經機器翻譯比上一代系統進步了一大截。不過,它並沒有證明機器翻譯在所有文件上都能做到與人工翻譯相同的水準。
技術的進展也沒有停在 2016 年。神經機器翻譯持續普及,近年大型語言模型(LLM)也加入了翻譯的行列。現在的 AI 可以在短時間內產出文法完整、讀起來流暢的譯文。
所以,拿過去那種生硬機器譯文的印象來評價現在的 AI 翻譯,並不公平。本文的前提是:AI 翻譯在許多用途上已經非常好用——要問的是,當必須確保「正確性」時,還剩下哪些工作。
「產出」與「品質保證」是兩回事
產出譯文,指的是讀原文、選用語、把譯文組織起來。這些工作,AI 大多都加快了。
但只要品質有明確要求,產出的譯文就還是得逐項檢查。例如:
- 原文的資訊有沒有漏掉?有沒有多出原文沒有的內容?
- 修飾關係、因果關係、肯定與否定,有沒有變樣?
- 數字、單位、專有名詞正不正確?
- 用語符不符合這個領域、這個脈絡?
- 同一個用語、同一種說法,全文是否一致?
- 譯文放到實際用途裡,行不行得通?
- 改了一處,有沒有在別處產生新的錯誤?
我所說的「品質保證成本」,不是只有最後跑一次自動檢查工具的費用,還包括對照原文與譯文、判斷譯文有沒有達到要求所投入的時間、專業知識與確認工夫。
當然,品質保證也有一部分可以自動化。提供用語建議、搜尋過往譯文、協助找出數字不一致或明顯的漏譯,都是 AI 和電腦輔助翻譯(CAT)工具的強項。只是,「產出自動化了」和「品質保證整個都不用做了」,是兩件完全不同的事。
譯後編修不是「把譯文看過一遍」
由人工修正機器翻譯或 AI 翻譯的輸出,一般稱為譯後編修。
如果工作只是讀讀譯文、改改不通順的句子和錯字,看起來確實輕鬆。但要確認譯文是否準確對應原文,就必須同時閱讀原文與譯文。譯文讀起來再自然,也不代表它正確反映了原文的意思。
做譯後編修的人,得先讀懂原文,再判斷 AI 是怎麼理解的、這個理解站不站得住腳、錯了該怎麼改。初稿品質好,譯後編修確實可能比從頭翻快。但實際要花多少時間,取決於原文難度、初稿品質和目標要求——有時候,光是找出錯誤、把它改對,就得花上不少工夫。
譯者檢查自己的譯文時,原文已經讀過、資料已經查過,每個用語怎麼選、句子怎麼寫,都是自己決定的,理由也大致記得。檢查當然不能省,但與第一次接觸原文和譯文相比,負擔通常會比較輕。換成第三方審校,就得從頭讀懂原文和譯文——這時的工作內容,其實和譯後編修相去不遠。
AI 產出的初稿,對審校的人來說同樣是「別人的譯文」。除了讀原文,還得讀 AI 的譯文,弄清楚它把原文理解成了什麼。和檢查自己的譯文相比,這就是多出來的一層工作。
所以,「譯後編修一定比從頭翻更累」和「有了初稿,工作量一定按比例減少」,這兩種說法都太武斷。
關於譯後編修的負擔,研究上通常從幾個面向來看:工作時間、實際的編修操作,以及認知負荷——也就是讀懂內容、判斷對錯所耗費的腦力。2025 年發表的一項英翻中實驗發現,用 GPT-4 輔助的譯後編修,工作時間並沒有比傳統譯後編修明顯縮短,編修操作方面的負擔反而增加,對認知負荷的影響也不一致。
這項實驗的參與者是 26 名研究生,結果當然不能直接套用到所有語言、領域和職業譯者身上。從這項研究可以看出的,並不是「AI 輔助沒有作用」,而是不能單純假設加入 AI 後,工作負擔就一定會減輕。
此外,ISO 18587:2017 也針對機器翻譯輸出的完整人工譯後編修流程,以及譯後編修人員應具備的能力,訂有相關要求。在這份標準裡,譯後編修是由具備相應能力的人執行的一道正式程序,不是把輸出瀏覽一遍就算數。
譯文再流暢,意思還是可能錯
現在的 AI 翻譯,最大的強項就是流暢。但站在品質保證的角度,這個強項是雙面刃。
生硬的譯文,問題自己會浮出來。文法正確、看似合理的譯文,反而容易藏住意思上的偏差:原文的某一段悄悄不見了、限制條件的範圍變了、多了一層原文沒有的因果關係。
用語也是一樣。舉例來說,trigger the function 如果被譯成日文的「機能の発火」(字面近似「功能的點火」),乍看之下可能像是某種專業說法。但實際翻譯時,應依對象和脈絡考慮「觸發該功能」「啟動該功能」或「呼叫該函式」等不同譯法。
舉這個例子,不是要評判哪一家的 AI。想說的只是:譯文流不流暢,和用語、意思恰不恰當,是兩個必須分開檢查的問題。
用途不同,要求的品質就不同
如果用 AI 翻譯只是想掌握大意,那麼讀懂譯文的大致內容,目的就達成了。這種用途下,現在的 AI 翻譯已經非常好用。
但譯文要作為成果交給別人,標準就不一樣了。除了好不好讀,還得對照原文檢查:意思一不一樣?用語恰不恰當?文件能不能發揮它該有的作用?萬一有錯,會不會造成實際的問題?
所以,一個人說「這譯文夠用了」,另一個人說「這還不能直接交出去」,這兩種評價未必互相矛盾,因為雙方是依據不同的用途和品質標準做出判斷。
圍繞 AI 翻譯的認知落差,不完全是對 AI 效能的評價不同。「翻譯做到什麼程度才算完成」,各自的標準不一樣,往往才是更大的原因。
定價看總工作量,不是看「有沒有用機器」
機器翻譯普及之後,有些譯後編修案子的單價會訂得遠低於人工翻譯,理由是「機器負責翻,人只要看一看」。我自己就看過譯後編修案件的招募資訊,開出的單價約為每個日文原文字元 1 日圓。
但單看數字,判斷不了一個單價合不合理。初稿品質、原文的專業程度、目標品質、出錯的後果、交件期限,都會影響實際工作量。如果品質要求不高、初稿又穩定,低單價未必不合理;反過來,如果得逐項對照原文、還需要專業判斷,就算有初稿,工作量也未必省得了多少。
所以,合理的價差不該來自「用了機器就打幾折」這種固定折扣,而該來自實際測量:達到所需品質的時間,究竟縮短了多少。真正該看的,不是第一版譯文多快出現,而是把譯文處理到可以交件,總共花了多少時間。
專利翻譯裡留下來的確認工作
在專利翻譯中,正確反映原文的意思,比譯文自不自然更重要。為了準確保留技術內容或權利範圍,有時甚至可以接受一定程度的不自然。所以品質保證得嚴格確認措辭會如何影響技術內容與權利範圍,包括:
- 請求項中記載的構成要素,以及彼此的關係;
- 單數、複數與選項的處理;
- 限定性表達有沒有多出來或漏掉;
- 請求項與說明書的記載是否一致;
- 與圖式符號是否對應;
- 所選用語在目標語言中的含義範圍。
就算 AI 縮短了產出初稿的時間,這些確認所需的時間也不一定會以同樣的比例縮短。另一方面,核對用語、搜尋相關文件、比較說法、檢查數字和圖式符號,這些工作靠 AI 和翻譯輔助工具確實能做得更快。
重點不在於「用 AI」還是「不用 AI」的二選一,而在於分清楚:哪些環節可以自動化,哪些環節還是得靠人來判斷。
降下來的,不是翻譯的全部成本
AI 大幅降低了產出譯文的成本。在某些用途下,幾乎立刻就能取得可直接派上用場的譯文。這是翻譯技術的明確進步。
但只要正確性、專業性、一致性或法律效果需要保證,產出的譯文就還是得經過驗證。這些工作同樣能靠 AI 提升效率,只是品質保證成本不會自動跟著產出成本以同樣的比例下降。
評估 AI 帶來的效益時,別只看譯文出現得多快,還要看達到所需品質總共投入了多少時間和工夫。
「編輯距離」是衡量文字改動幅度的指標,但它不等於總工作量。就算譯文幾乎不用改,「確認它是對的」本身也要花時間。所以,評估 AI 帶來的效益時,除了實際的修改量,也得把確認所花的時間算進去。
把這兩種成本分開來看,我們就比較容易跳出「AI 讓翻譯近乎免費」和「專業翻譯不能用 AI」這兩種極端說法,依照用途、品質和風險,做出更貼近實際的判斷。
參考資料
- Google Research, Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation, 2016.
- Yao, Y., Han, T., & Li, D., Measuring translation trainees’ effort in AI-assisted post-editing: a multi-method approach, 2025.
- ISO, ISO 18587:2017 — Translation services — Post-editing of machine translation output — Requirements.