ZAOSEQ LABS / LANGUAGE & INTERACTION Research Preview
造序注音
ZaoSeq Bopomofo · 造序科技(籌備中)
讓注音不只看字頻,也看上下文。
Context-aware Traditional Chinese Bopomofo decoding and reranking.
LIVE DEMO
試著輸入一句話
填入範例或直接輸入注音。
尚未輸入注音。
HOW IT WORKS
從讀音到候選
- 注音輸入
- ZaoSeq Decoder
- Corpus Language Model 持續整合中
- Candidate Sequences
- Contextual Reranking
- 最終輸出
Experimental contextual ranking powered by Laya Multilingual. Laya 只對既有候選做決策,不自由生成文字。
INPUT TOLERANCE / IN PROGRESS
打錯一個注音,也不一定要全部重來。
造序注音正在實驗利用整句上下文與注音距離,從有限的合法候選中找回較可能的輸入。
若 backend 提供修正資訊,Demo 會在尚未確認的文字旁輕提示;已確認的文字仍由使用者控制。
RESEARCH STATUS
目前仍是研究預覽
目前的 contextual model 尚未穩定勝過 deterministic baseline。系統持續改善 corpus、candidate generation 與 typo tolerance;尚不建議作為每日主要輸入法。
閱讀 Technical Notes 與 Preliminary DEV resultsPRIVACY
資料怎麼處理
不需要帳號。輸入內容僅用於當次推論,不儲存,也不作為模型訓練資料。
線上 Demo 送出時會向本站 API 傳送前文與注音;未送出的 composition 只留在頁面。本站沒有輸入內容分析工具。基礎設施可能記錄連線資訊;請勿輸入敏感資料。
DATA & LICENSE
資料與授權
字音資料使用 CNS11643 中文標準交換碼全字庫,來源為數位發展部,依政府資料開放授權條款第 1 版(Open Government Data License Taiwan 1.0)使用。Laya Multilingual 為第三方模型,依 Apache-2.0 授權使用。
內建詞庫由造序專案人工整理;研究用語料統計另使用政府開放資料。逐項來源與授權見 完整資料來源紀錄。
完整資料與第三方授權自行執行造序注音
完整原始碼、測試、啟動說明與 Kaggle Notebook 已放在公開倉庫。公開 Demo 的 API 必須連接實際模型服務;服務未就緒時不會顯示模擬結果。
GitHub 原始碼