Ressources numériques en sciences humaines et sociales OpenEdition Nos plateformes OpenEdition Books OpenEdition Journals Hypothèses Calenda Bibliothèques OpenEdition Freemium Suivez-nous

駭客松: 從多語種語料庫自動提取時間軸(徵求參與)

English version: Automated Timeline Extraction from a Multilingual Corpus (Hackathon)

Version en français : Hackathon (appel) : Les LLMs au défi du temps, d'une langue à l'autre

Lord, Lord, what a change had come over her! the softness of motherhood; its egotism too. Last time they met, Peter remembered, had been among the cauliflowers in the moonlight, the leaves “like rough bronze” she had said, with her literary turn; and she had picked a rose. She had marched him up and down that awful night, after the scene by the fountain; he was to catch the midnight train. Heavens, he had wept!

吳爾芙在《達洛維夫人》(1925)中的這段文字,究竟提到了哪些事件?這些事件應該按照什麼順序排列在時間軸上?我們能否為它們確定具體的日期?能否推算它們的持續時間?又是否能夠測量事件與事件之間的時間間隔?更進一步的說,這樣一段簡短的文字,是否可以被轉寫為結構化的時間資訊?

這些問題正是許多敘事類文本所引發的核心挑戰。這裡所說的敘事類文本,可以廣義地理解為:凡是描述事件,並使這些事件透過因果關係或單純的時間先後彼此連結的文本。自2023年以來,已經有許多研究開始探討大型語言模型(LLMs)在時間推理方面的能力,也使這類問題重新成為數位人文與自然語言處理共同的焦點。

Huma-Num DISTAM+聯盟將與法國現代中國研究中心、法國在臺協會合作,舉辦一場駭客松,專門討論上述問題。

本次駭客松的目標,是匯集多支團隊,共同建立一套基準與比較方法,並找出針對這類問題的解決方案。透過不同語言、不同文本類型與不同技術路徑之間的交叉測試,我們希望進一步評估:如何從多語種語料庫中自動提取事件、重建時間順序,並將敘事文本轉化為可分析、可比較的時間軸資料。

問題設定

時間推理會涉及多種類型的問題。這些問題既關乎事件與時間資訊的表徵方式,也關乎模型如何排序、測定與比較不同語言及文化脈絡中的時間關係。

1. 表徵與結構化

  • 1.1. 應該採用何種結構來記錄事件及其相關的時間資訊?(這裡先暫時擱置「事件」本身定義的問題。)
  • 1.2. 應該如何記錄事件之間的先後順序?又該如何表示兩個事件之間的時間間隔?
  • 1.3. 應該如何呈現事件的時間屬性,例如事件發生於何時、持續多久?
  • 1.4. 面對時間詞彙本身的不確定性,例如期間、時刻、約略時間或模糊時間,應該如何處理?

2. 時間排序

  • 2.1. 可以採用哪些策略將事件依照時間順序排列?
  • 2.2. 哪些策略的表現較好?這種策略的優勢又體現在哪些層面?
  • 2.3. 這些策略各自依賴哪些處理流程?
  • 2.4. 如何盡可能精確地測量已記錄事件之間的時間間隔?
  • 3. 年代測定
  • 3.1. 針對文本中提及的事件進行年代測定時,可以得到哪些結果?
  • 3.2. 若脫離西歐既定的時間參照框架,年代測定的結果是否仍然具有可比性?
  • 3.3. 年代測定是否有助於進一步精確化,或確認事件之間的時間序列?
  • 3.4. 目前的測定方法是否仍有改進空間?如果有的話,那麼應該優先考慮哪些方向?

4. 文獻較少的語言與文化

  • 4.1. 歷史文本是否會為上述問題帶來特定挑戰?
  • 4.2. 根據分析文本所使用語言的不同,各類模型的表現水準有何差異?
  • 4.3. 面對最具挑戰性的語料庫,應該制定哪些策略來強化模型表現,並提升結果的穩定性?
  • 5. 複雜度與文本長度
  • 5.1. 在駭客松期間測試的處理流程中,表現較差的文本具有哪些共同特徵?
  • 5.2. 對於長篇文本,或時間資訊密度特別高的文本,是否應該在預處理階段單獨處理?
  • 5.3. 為了突破目前已知的限制,可能考慮採取哪些策略?

文本語料庫

本次駭客松所使用的語料庫,係於2026年夏季透過徵集活動建置而成,該語料庫彙集了多種描寫事件的散文文本。這些文本將不同事件相互對照,並將其置於特定的時間軸之中。這種時間關係有時以明確方式表示,例如直接出現日期或時間詞。有時則以較為隱晦的方式呈現,例如透過因果關係、敘事順序或上下文脈絡暗示事件之間的先後。

本語料庫的設計,建立在一項基本假設之上:模型的時間推理能力,可能會因文本類型與語言條件而有所差異。前者包括文本長度、文體風格,以及時間資訊的密度,後者則包括歷史語言與當代語言的差異,或者是各語言自身的結構特徵。

因此本次語料庫刻意保留高度的多樣性,它涵蓋英語、中文與法語等三種主要語言及其歷時性的變體(例如文言文),並收錄來源與篇幅各不相同的文本,包括文學作品、歷史文本、新聞報導等。透過這樣的設計,本次駭客松希望能夠觀察不同語言、不同文類與不同時間結構的變因之下,將如何影響事件提取、時間排序與年代測定的結果。

目標:

本次駭客松的目標包括:

科學目標

  • 彙整大型語言模型時間推理研究的現況,相關文獻目錄將於2026年9月14日彙整並分享。
  • 將目前已提出的各類方法應用於多語種語料庫,藉此評估方法的效能,並發布根據本語料庫建立的基準測試結果。
  • 提出一套結構化策略,用以記錄從文本中提取出的時間元素。
  • 識別可能阻礙時間推理的文本特徵與薄弱環節。
  • 提出克服這些障礙的策略,並在條件允許的情況下加以測試。
  • 若研究結果足以支撐後續發表,則撰寫一篇綜述文章,彙整本次工作所獲得的成果。

交付成果

本次駭客松預期產出以下成果:

  • 一套用於時間推理研究的三語標註資料集。
  • 一套用以描述所提取時間資料的結構模型。
  • 一組針對時間推理方法的基準測試結果,用以比較不同方法在各類語料庫中的表現。
  • 若協作式駭客松期間取得令人鼓舞的成果,將進一步撰寫並發表一篇關於時間資訊提取實驗的研究文章。該文章將於駭客松結束後定稿,並投稿至聚焦於計算研究、自然語言處理(NLP)的相關期刊或研討會。

參與者將依據NISO CRediT系統獲得署名。所有使用的語料庫也將被系統性地引用與記錄。

時程表

  • 徵件啟動:2026年6月13日
  • 報名截止日期:2026年8月17日 (2026年7月21日)
  • 主辦單位回覆:2026年7月31日
  • 提供文獻資源與資料集:2026年9月14日
  • 駭客松舉辦時間:2026年9月21日至24日(詳情請參閱下文)

駭客松舉辦地點

  • 孔多塞校園(奧貝維利耶)
  • 中央研究院(臺北)

駭客松流程

9月21日:

  • 線上舉行(巴黎時間上午10點,臺北時間下午4點):介紹駭客松並制定活動方針,確立初步任務。

9月22日:

  • 臺北開始工作。
  • 分享環節(臺北時間下午 3 點或 4 點):彙整進展與障礙,檢視目標。
  • 巴黎接力。

9月23日:

  • 臺北開始工作。
  • 分享環節(臺北時間下午 3 點或 4 點):彙整進展與障礙,檢視目標。
  • 巴黎接力。

9月24日:

  • 共同工作4小時(臺北時間下午2點起,巴黎時間上午8點起):整理成果,包括交付物、評估報告與書面文件。
  • 閉幕。

徵集公告

語料庫徵集

我們誠摯邀請所有希望提交或分享語料庫,以供本次駭客松使用的團隊及個人與我們聯繫。語料庫須為英語、法語或中文的某種變體,文本則須包含敘事性內容,例如故事、文章、報告等。所有來源都將在駭客松的成果報告中註明。

參與徵集

我們誠摯地邀請所有對自然語言處理及計算語言學感興趣,並有意願參與本次駭客松的學者專家踴躍報名。唯前往巴黎或臺北的交通及住宿費用,須由參與者自行負擔。本次駭客松將以實體形式舉行。其中9月21日的介紹與策略制定環節將在線上進行。主要工作語言為英文,現場亦會使用法文和中文。

回應徵集公告之方式

郵件寄送地址

  • 請寄至:[marie.bizais@cnrs.fr](mailto:marie.bizais@cnrs.fr)
  • 郵件主旨請以「LLM Temporal Reasoning」開頭。

郵件內容

  • 若提供語料庫,請註明:文本數量、來源、語言、產出日期,以便了解所涉及的語言發展階段;平均長度方面,法語和英語請提供單字數及字元數,中文請提供字數。
  • 如果打算參加駭客松,請提供:姓名、稱謂、身分。如果您是博士生,請註明指導教授姓名。
  • 請報名時一併提供所屬機構、自然語言處理的學歷或經驗程度,以及參與動機。

參考資料:

Lande Dmytro and Strashnoy Leonard. LLM Reconstructions of the Text Narrative With and Without the Time Markers (October 26, 2024). Available: http://dx.doi.org/10.2139/ssrn.5000687

Pattaraphon Kenny Wongchamcharoen and Paul Glasserman. Do Large Language Models (LLMs) Understand Chronology? (2025). Available: https://arxiv.org/abs/2511.14214

SUN Feifei et al. Benchmarking Temporal Reasoning: Can Large Language Models Navigate Time When Stories Refuse to Follow a Straight Line? First Workshop on Foundations of Reasoning in Language Models (2025). Available: https://openreview.net/forum?id=jogKc4OluB

Jin, Ming et al. Time-LLM: Time Series Forecasting by Reprogramming Large Language Models. International Conference on Learning Representations (2024). Available: https://proceedings.iclr.cc/paper_files/paper/2024/file/680b2a8135b9c71278a09cafb605869e-Paper-Conference.pdf

Yeager, S., (2023) “Time Maps: Theory and Method”, Journal of Cultural Analytics 8(3). https://doi.org/10.22148/001c.87937

Zhang et al., Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narratives, Findings (2024). Available: https://aclanthology.org/2024.findings-emnlp.963/

相關單位:

的Huma-Num DISTAM+聯盟(Digital Studies Africa, Asia, and the Middle East)由法國國家科學研究中心(Centre national de la recherche scientifique)第2999號研究支援單位(UAR 2999-études aréales)所主持,致力於在法國區域研究領域中推廣與探索計量研究的方法。

法國當代中國研究中心(Centre d’études français sur la Chine Contemporaine)是由法國外交及歐洲事務部(Ministère de l’Europe et des affaires étrangères)與法國國家科學研究中心共同監管的公共研究機構,致力於研究中國、臺灣、香港及澳門的政治、經濟、社會與文化變遷。

法國在臺協會(Bureau français de Taipei)為法國在臺灣的官方代表機構,致力於推動臺法合作,其中也包含學術研究的交流

法國當代中國研究中心臺北分部,邀請Huma-Num DISTAM+聯盟籌備,並與法國在臺協會合作,共同辦理此次駭客松計畫。

圖片來源:〈撰寫短篇故事:連環圖(小學生活)〉,Eklablog,網址:https://quelleclasse.eklablog.com/ecrire-une-courte-histoire-images-sequentielles-cp-a212344067
Marie Bizais-Lillig
Marie Bizais-Lillig

OpenEdition vous propose de citer ce billet de la manière suivante :
Marie Bizais-Lillig (1 juillet 2026). 駭客松: 從多語種語料庫自動提取時間軸(徵求參與). Carnet hypothèses du consortium Huma-Num distam+ (DIgital STudies Africa, Asia, Middle East). Consulté le 15 septembre 2026 à l’adresse https://doi.org/10.58079/16hru


Vous aimerez aussi...

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

This site uses Akismet to reduce spam. Learn how your comment data is processed.