论文标题:CaTS-Bench: Can Language Models Describe Numeric Time Series?
作者: Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu
机构:罗马萨皮恩扎大学(Sapienza University of Rome),加州大学圣地亚戈分校(UCSD),ItalAI Labs
论文链接:https://arxiv.org/abs/2509.20823
Cool Paper:https://papers.cool/arxiv/2509.20823
HF:https://huggingface.co/datasets/a9f3c7e2/CaTSBench
TL;DR:本文提出CaTS-Bench,一个针对语言模型生成数值时间序列描述的基准测试框架。它包含大规模多样化时间序列数据集,设计了定量评估指标(如BLEU、ROUGE)和定性分析方法。实验表明,尽管语言模型在描述简单趋势时表现尚可,但在处理复杂模式(如周期性和噪声)时存在明显不足,凸显了该领域研究的挑战与机遇。
关键词:语言模型、时间序列描述、描述生成、基准测试

此公众号的文章皆系本人原创,辛苦码字不易!如需转载,引用请注明出处。如商用联系作者。
点击文末阅读原文跳转本文arXiv链接
时间序列自动文本描述,即通过自然语言描述数值型时间序列的任务,需要进行数值推理、趋势解读和语境理解。然而,现有的基准往往依赖合成数据或过于简单的描述文本,且通常忽略元数据和视觉表征。为了填补这一空白,本文引入了CaTS-Bench,这是首个用于上下文感知时间序列自动文本描述的大规模真实世界基准。CaTS-Bench源自11个多样化的数据集,这些数据集被重新构建为描述和问答任务,包含约46.5万个训练时间戳和10.5万个测试时间戳。每个样本都包括一个数值序列片段、上下文元数据、一张折线图图像和一段描述文本。这项工作的一个关键贡献是用于生成参考描述文本的可扩展流程:虽然大多数参考文本由一个“先知”大语言模型(LLM)生成,并通过事实核查、人类区分度研究和多样性分析进行验证,但本文也提供了一个包含579个测试描述文本的人工复查子集,这些文本从大语言模型的输出中提炼而来,以确保准确性和类人文风。除了描述任务外,CaTS-Bench还提供了460道多项选择题,针对时间序列推理的更深层次方面。本文进一步提出了新的定制化评估指标,并对领先的视觉语言模型(VLMs)进行了基准测试,突出了它们的优势和持续存在的局限性。总之,这些贡献使CaTS-Bench及其描述生成流程成为时间序列分析与基础模型交叉领域未来研究的可靠且可扩展的基础。

CaTS-Bench
A: 该论文旨在解决时间序列自动文本描述(Time SeriesCaptioning, TSC)任务中现有基准的局限性,具体包括:
为此,作者提出 CaTS-Bench,首个大规模、多模态、上下文感知的真实世界时间序列描述与推理基准,通过可扩展的标注流水线、细粒度评估指标与诊断式问答任务,为TSC研究提供可靠且可扩展的评测与训练基础。
A:论文在第2节“Related Work”中系统梳理了与时间序列描述(Time SeriesCaptioning, TSC)相关的三大研究脉络,并指出它们的局限,从而凸显 CaTS-Bench 的必要性。核心文献与对应贡献/不足如下:
综上,现有工作要么聚焦预测而非描述,要么描述任务受限,缺乏同时覆盖“真实序列+元数据+视觉+高质量自然语言描述”的大规模基准。CaTS-Bench 通过整合 11 个真实数据集、57 万时间步、多模态信息及可扩展的高质量标注流水线,首次填补了这一空白。

论文通过“构建基准 + 验证基准 + 诊断模型”的三段式方案系统性地解决时间序列描述(TSC)领域的评估与训练瓶颈,具体措施如下:

通过上述“数据-评估-诊断”闭环,CaTS-Bench 不仅为 TSC 提供了可复现、可扩展的真实基准,也明确指出了下一代模型需重点突破的方向:强化数值精度、提升视觉-数值 grounding、避免过度依赖语言先验。

CaTS-Bench 半合成数据生成流程概述
A: 论文围绕 CaTS-Bench 共开展四类实验,覆盖 时间序列描述(TSC)生成质量、多选问答(Q&A)诊断能力、视觉模态贡献度 与 评估协议本文性,具体设置与结论如下:
目的:衡量模型在 零样本 与 微调 两种场景下,同时满足“语言流畅、数值准确、上下文一致”的能力。
设置
结果(表 3/4 & 附录 G)


类别 | 最佳模型 | 主要结论 |
|---|---|---|
闭源 | Gemini 2.0 Flash | 语言指标领先,但数值推理仍低于 70 % |
开源-零样本 | InternVL-2.5-38B | 与闭源差距 <3 个百分点,但 Numeric Score 仅 0.68 |
开源-微调 | LLaVA-v1.6-Mistral-FT | 所有语言指标提升 10–20 %,Numeric Score 升至 0.73,反超部分闭源模型 |
PAL 辅助 | QwenVL-PAL | Statistical Inference Accuracy 达 97 %,验证“代码即推理”有效性 |
目的:细粒度探查模型在 序列-文本-图像 三模态间的对齐与推理盲区。
任务与规模
结果(图 3 & 表 17)

)
能力维度 | 最高准确率 | 观察 |
|---|---|---|
描述→序列 | GPT-4o 96 % | 文本→数值反向检索相对容易 |
序列→描述 | Gemini 2.0 Flash 78 % | 数值→文本正向匹配更难 |
描述→图像 | **全体模型 ≈ 30 %**(随机 25 %) | 视觉 grounding 显著失效 |
统计比较 | Phi-4-MI 82 % | 二元选择仍低于人类 90 % |
目的:量化“线图”(Line-Chart)对 TSC 的实际增益,并解释模型如何使用图像。
实验 a:纯文本 vs 图文双模态
结果(图 4 & 表 15)

VL(视觉 - 语言输入)和 L(纯文本输入)之间的性能差异
实验 b:视觉注意力可视化(LLaVA-1.6)
实验 c:替代视觉编码
目的:确保 CaTS-Bench 评分反映“内容正确性”而非“模仿 Gemini 风格”。
实验设计
结果(表 10 & 11)
实验从“生成质量→诊断推理→模态贡献→评估可信”四个层面系统验证:

时间序列振幅比较问题示例

时间序列峰值比较问题示例

时间序列方差比较问题示例

时间序列均值比较问题示例

描述匹配问题示例

图表匹配问题的示例

时间序列匹配问题示例

包含和不包含数值时间序列输入的生成说明文字对比

微调模型试图推断平均值,但失败了

微调模型成功推断出均值和标准差,误差可忽略不计
附录有更加详细的实验结果,包括提示词模板等内容,可以阅读原文获取详情。
此公众号的文章皆系本人原创,辛苦码字不易!如需转载,引用请注明出处。如商用联系作者。