ZaoSeq 造序科技Labs

ZAOSEQ LABS / LANGUAGE & INTERACTION Research Preview

造序注音

ZaoSeq Bopomofo · 造序科技(籌備中)

讓注音不只看字頻,也看上下文。

Context-aware Traditional Chinese Bopomofo decoding and reranking.

LIVE DEMO

試著輸入一句話

檢查服務中…

用微軟注音時,先按 Shift 切到「英」模式,再照注音鍵盤位置輸入英數碼。

第一次使用?看鍵盤輸入方式

這是網頁選字體驗,不會接管微軟注音已組成的中文字。微軟注音使用者可按 Shift 切到「英」模式,再用大千注音的鍵位輸入。

y94 fm4 對應 ㄗㄞˋ ㄑㄩˋ;二聲按 6、三聲 3、四聲 4、輕聲 7,一聲以空白結束。也可以直接貼上注音符號。取得候選後,點選想要的文字接續輸入。

填入範例:
選取候選後接續前文;已確認文字不會自動改寫。

按「取得候選」時,前文與注音才會送至本站 API。請勿輸入機密內容。資料處理說明

填入範例或直接輸入注音。

尚未輸入注音。

HOW IT WORKS

從讀音到候選

  1. 注音輸入
  2. ZaoSeq Decoder
  3. Corpus Language Model 持續整合中
  4. Candidate Sequences
  5. Contextual Reranking
  6. 最終輸出

Experimental contextual ranking powered by Laya Multilingual. Laya 只對既有候選做決策,不自由生成文字。

INPUT TOLERANCE / IN PROGRESS

打錯一個注音,也不一定要全部重來。

造序注音正在實驗利用整句上下文與注音距離,從有限的合法候選中找回較可能的輸入。

若 backend 提供修正資訊,Demo 會在尚未確認的文字旁輕提示;已確認的文字仍由使用者控制。

RESEARCH STATUS

目前仍是研究預覽

目前的 contextual model 尚未穩定勝過 deterministic baseline。系統持續改善 corpus、candidate generation 與 typo tolerance;尚不建議作為每日主要輸入法。

閱讀 Technical Notes 與 Preliminary DEV results

PRIVACY

資料怎麼處理

不需要帳號。輸入內容僅用於當次推論,不儲存,也不作為模型訓練資料。

線上 Demo 送出時會向本站 API 傳送前文與注音;未送出的 composition 只留在頁面。本站沒有輸入內容分析工具。基礎設施可能記錄連線資訊;請勿輸入敏感資料。

DATA & LICENSE

資料與授權

字音資料使用 CNS11643 中文標準交換碼全字庫,來源為數位發展部,依政府資料開放授權條款第 1 版(Open Government Data License Taiwan 1.0)使用。Laya Multilingual 為第三方模型,依 Apache-2.0 授權使用。

內建詞庫由造序專案人工整理;研究用語料統計另使用政府開放資料。逐項來源與授權見 完整資料來源紀錄

完整資料與第三方授權

自行執行造序注音

完整原始碼、測試、啟動說明與 Kaggle Notebook 已放在公開倉庫。公開 Demo 的 API 必須連接實際模型服務;服務未就緒時不會顯示模擬結果。

GitHub 原始碼