A clinical researcher studying natural voice signals in a calm research suite.
CNS 研究

多模态纵向认知数据 用于 CNS 研发。

来自每日老年人语音对话的真实世界、纵向认知、语音和行为数据集。结构化用于生物标志物发现、数字试验终点、药物警戒和真实世界证据。
阿尔茨海默病 · MCI · 失智症 · 老年抑郁 · 帕金森病 · 神经退行性疾病
50K+
已记录会话
12+
纵向月份
31
每次会话变量数
Daily
采集频率
100%
去标识化
受试者 anon_8f3a2c · 36 周轨迹
1000750500250W1W4W8W12W16W20W24W28W32W36BaselineAlertComposite scoreMood intensityClinical alert
数字生物标志物

由 NLP 提取的认知标志物(TTR、MLU、连贯性、信息密度),并与 MoCA / MMSE 对照验证 — 对早期变化更敏感。

连续终点

每日数据点,而不是季度临床就诊。以周级分辨率追踪药效,不必等待 3–6 个月后的下一次评估。

真实世界证据

来自居家环境的自然数据 — 不是人工实验室场景。适合 FDA / EMA 真实世界证据提交所需的生态效度。

我们采集什么

覆盖 CNS 三大支柱的连续语音衍生信号。

情绪

从语音特征、词汇标志和自我报告推断情绪状态 — 每日采集,并按受试者建立基线。

认知

覆盖回忆、流畅性、定向力和参与度的综合认知指数 — 在 7 天、30 天和 90 天窗口中追踪。

依从性

双向确认的用药依从性,包含漏服时间戳和下游症状相关性。

自然环境数据优势

为什么自然环境数据会改变一切。

现有数字认知工具依赖结构化测试。Amigo 从自然的每日对话中采集数据 — 没有测试焦虑、没有练习效应,也没有患者负担。

维度Amigo结构化测试工具
采集方式自由形式每日对话提示式认知任务(画钟、图片描述、纸牌游戏)
频率每日 — 每次对话都是一个数据点每周到每季度 — 预约式会话
患者负担零 — 对话本身就是产品(陪伴)需要主动参与测试流程
练习效应无 — 没有重复测试结构可学习分数会因重复接触而提高
测试焦虑无 — 数据采集嵌入愉快的日常习惯表现焦虑可能扭曲结果
生态效度高 — 居家环境中的真实语音低到中等 — 人工测试条件
数据模态语言 + 声学 + 行为 + 情绪通常每个工具只有 1–2 个维度
依从性高 — 老人愿意聊天随时间下降 — 测试疲劳
纵向深度每位受试者在数月内有数百次会话最多通常只有数十次会话
单数据点成本边际成本 — 无临床人员、无设备发放更高 — 需要监督执行或专用设备

“结构化测试工具”指基于提示式测试的数字认知评估平台(画钟、图片描述、反应时间任务)— 这类工具需要患者主动参与。

数据生成管线

从自然语音到可用于研究的结构化数据集。

每一步都由内部工程化并运营,在每个阶段都有明确版本控制,并保留每个数据点生成过程的完整审计轨迹。

Voice Conversation
Daily · Natural · Unstructured
Amigo Speech Engine
In-house · Real-time STT
Amigo Cognitive Pipeline
31 variables · multimodal
Structured Snapshot
JSON · Versioned · Audited
De-identification & Export
GDPR · HIPAA · BAA
数据目录

每次会话 31 个结构化变量。

覆盖认知、语音、行为、情绪和临床维度。每次导出均附带版本化数据结构和数据字典。

FieldTypeExampleCategory
subject_idstringanon_8f3a2cID
session_datedate2026-02-28ID
call_duration_secondsint540Session
word_countint312Cognitive
type_token_ratiofloat0.68Cognitive
mean_utterance_lengthfloat8.4Cognitive
words_per_minutefloat98Cognitive
repetition_ratefloat0.05Cognitive
coherence_scoreint (1-10)8Cognitive-AI
idea_density_scoreint (1-10)7Cognitive-AI
word_finding_scoreint (1-10)9Cognitive-AI
composite_scoreint (0-1000)742Cognitive
participation_ratiofloat0.45Behavioral
turn_countint24Behavioral
engagement_qualityenumgoodBehavioral
mood_primaryenum (5)positiveMood
mood_intensityint (0-10)7Mood
alert_triggeredboolfalseAlert
alert_natureenumnullAlert
alert_severityenumnullAlert
f0_mean_hzfloat185.3Voice
f0_std_hzfloat28.7Voice
jitter_percentfloat1.12Voice
shimmer_percentfloat3.45Voice
hnr_dbfloat18.2Voice
speech_ratefloat3.8Voice
pause_ratefloat0.22Voice
mean_pause_duration_msint680Voice
composite_z_scorefloat+0.3Baseline
baseline_sessionsint12Baseline
trendenumstableBaseline

队列拆分

数据集中临床画像的分布

35%
40%
15%
10%
Mild Cognitive Impairment
Healthy Aging
Early-Stage Dementia
Geriatric Depression

指标分布

AI 评估连贯性得分的样本直方图

1-22-33-44-55-66-77-88-99-10
Coherence score distribution

语音频率演变

24 周内 F0 均值(Hz)— 单一受试者

W1W6W10W14W18W22192180168
F0 mean (Hz)
↓ declining trend
每次会话内部

每次对话会产生什么。

每次通话都会生成一个多维结构化快照。带版本、带时间戳,并可追踪数据血缘。

NLP 认知标志物

通过 Amigo's 确定性 NLP 管线,从语音模式中提取量化语言指标。

词型-词例比平均话语长度词/分钟重复率词数

AI 认知评分

由 Amigo 认知引擎评分的高阶语言功能,并与临床量表校准。

连贯性(1-10)信息密度(1-10)找词能力(1-10)综合分(0-1000)

语音与声学生物标志物

从原始音频中提取韵律和频谱特征。用于抑郁、帕金森病和认知下降的已验证标志。

F0 均值 / 标准差JitterShimmerHNR语速停顿率停顿时长

行为指标

参与度、互动比例和对话动态 — 揭示随时间变化的行为模式。

参与比例轮次计数互动质量说话时长

情绪与情感

5 类情绪分类,带连续强度评分和会话级情绪语境。

主要情绪(5 类)强度(0-10)情绪语境氛围

临床提醒

结构化检测抑郁标志、认知混乱、身体不适和安全信号。

提醒布尔值性质(4 类)严重程度(4 级)临床细节

纵向基线

个体内 z 分数基线,用于个人轨迹追踪和变化检测。

Z 分数变化基线期趋势方向会话数量
导出结构

一次对话。一条结构化记录。

每条记录代表一次会话。可提供 JSON、CSV 或 Parquet 格式 — 并附带版本化数据字典和审计血缘。

1
受试者层级
匿名 ID、年龄段、性别、采集地点
2
会话层级
全部 31 个变量 — 认知、语音、行为、情绪、提醒
3
语音层级
F0、jitter、shimmer、HNR、停顿模式 — 每次会话的声学生物标志物
4
基线层级
个人基线、z 分数、综合指数演变、趋势标记
session_record.json
{
  "subject_id": "anon_8f3a2c",
  "age_band": "75-79",
  "session_date": "2026-02-28",
  "call_duration_seconds": 540,
  "cognitive": {
    "word_count": 312,
    "type_token_ratio": 0.68,
    "mean_utterance_length": 8.4,
    "repetition_rate": 0.05,
    "words_per_minute": 98,
    "coherence_score": 8,
    "idea_density_score": 7,
    "word_finding_score": 9,
    "composite_score": 742
  },
  "voice": {
    "f0_mean_hz": 185.3,
    "f0_std_hz": 28.7,
    "jitter_percent": 1.12,
    "shimmer_percent": 3.45,
    "hnr_db": 18.2,
    "speech_rate": 3.8,
    "pause_rate": 0.22,
    "mean_pause_duration_ms": 680
  },
  "behavioral": {
    "participation_ratio": 0.45,
    "turn_count": 24,
    "engagement_quality": "good",
    "user_speech_duration_s": 245
  },
  "mood": {
    "primary": "positive",
    "intensity": 7
  },
  "alert": {
    "triggered": false,
    "nature": null,
    "severity": null
  },
  "baseline_delta": {
    "composite_z_score": +0.3,
    "sessions_in_baseline": 12,
    "trend": "stable"
  }
}
临床验证

建立在同行评审研究基础上。

与既有临床量表的初步内部相关性已完成。外部多中心验证正在进行中。

指标 ↔ 临床量表相关性

初步 · 内部验证队列(N = 120)

Amigo metricScalerDirection
Composite ScoreMoCA0.72↑↑
Type-Token RatioMMSE0.65↑↑
Idea DensityMoCA0.68↑↑
Word Finding ScoreBNT0.71↑↑
Repetition RateMMSE-0.58↑↓
Pause RateMoCA-0.54↑↓
F0 Std (Hz)GDS-0.49↑↓
Mood IntensityGDS-0.61↑↓
JitterUPDRS-III0.52↑↑
Speech RateMoCA0.47↑↑
MoCA — Montreal Cognitive AssessmentMMSE — Mini-Mental State ExaminationGDS — Geriatric Depression ScaleBNT — Boston Naming TestUPDRS-III — Unified Parkinson's Disease Rating Scale

验证方法

  1. 1

    Paired assessment: Subjects completed standard clinical scales (MoCA, MMSE, GDS, BNT) within 48h of Amigo conversation sessions.

  2. 2

    Pearson correlation: Each metric was correlated with the clinically closest scale at subject level, controlling for age and education.

  3. 3

    Longitudinal sensitivity: Change scores over 6 months vs. clinical re-assessment — Amigo composite detected decline 4–8 weeks earlier than quarterly MoCA.

基于已发表研究

  • Type-Token Ratio decline as MCI marker Bucks et al., 2000; Forbes-McKay & Venneri, 2005

  • Idea density predicting AD onset Snowdon et al. (Nun Study), 1996

  • Pause patterns and speech rate in cognitive decline Hoffmann et al., 2010; Roark et al., 2011

  • F0 and jitter as depression biomarkers Cummins et al., 2015; Low et al., 2011

  • Vocal shimmer / HNR in Parkinson's disease Tsanas et al., 2012; Rusz et al., 2011

  • Spontaneous speech analysis for dementia screening Fraser et al., 2016; Luz et al., 2020

当前状态
内部验证完成 · 外部验证进行中

正在寻找学术和制药合作伙伴开展多中心验证研究。

研发应用

这些数据正在被用于哪些场景。

覆盖神经退行性疾病、老年精神医学、临床药物研发和真实世界证据。

阿尔茨海默病与失智症早期检测

用细微语言标志训练模型(TTR 下降、重复增加、信息密度降低),这些信号可能比临床诊断提前数月或数年出现。纵向基线可实现个体内变化检测。

生物标志物发现预测建模临床前检测

临床试验数字终点

将连续认知快照作为 II–III 期试验的数字终点。周级分辨率相较季度 MMSE 对变化更敏感,患者负担更低,并支持远程监测。

数字终点药效II–III 期远程监测

老年抑郁与社交孤立

用于研究抑郁发生、社交孤立和干预效果的纵向情绪轨迹、参与度下降模式和提醒频率数据。

情绪轨迹社交孤立干预研究

监管真实世界证据

来自真实居家场景的自然、连续数据。适用于 FDA / EMA 上市后监测、标签扩展和真实世界证据包。

RWE上市后监测FDA / EMA标签扩展

语音与声学生物标志物研究

追踪数月内 F0 下降、jitter / shimmer 演变和停顿模式变化。用于抑郁筛查、帕金森病监测和早期认知变化的已验证语音标志。

语音生物标志物F0 / Jitter / Shimmer抑郁筛查帕金森病

语音与语言生物标志物验证

将计算语言学和声学特征与既有临床认知量表交叉验证。成对的指标 + 评分数据可支持稳健的多模态生物标志物验证。

NLP 验证语言生物标志物量表校准
队列适配

为 CNS 试验中最难触达的人群而构建。

语音优先采集去除了限制老年或认知脆弱人群数字终点采集的大部分摩擦。

老年抑郁

在研究中心就诊之间提供每日情绪信号,并进行弱信号提醒。

MCI 与早期阿尔茨海默病

无需重复正式测试即可获得纵向认知标志。

帕金森病与运动障碍

居家场景中的语音特征和依从性报告。

精神分裂症与双相障碍

在临床接触之间提供每日情绪与参与度信号。

疼痛与长新冠

通过自然对话追踪患者报告的症状及其影响。

照护者 / 双人组研究

在适当情况下,从家庭信息提供者并行采集信号。

试验集成

可嵌入你已经运行的研究技术栈。

纯语音采集

无需可穿戴设备、无需 App、无参与者负担。队列成员只需接电话 — 就这样。

API 优先数据流

按参与者输出时间序列到你的数据湖。可按需兼容 REDCap 和标准 CDISC 映射。

审计级记录

每次通话、转录、评分、提醒和访问事件都有时间戳,不可变并可导出。

监管姿态

符合 HIPAA 控制要求、基于角色的访问、传输与静态存储加密、可提供 BAA、可按需提供 21 CFR Part 11 路线图。

数据质量与合规

按赞助方和 IRB 已有假设来设计。

传输中与静态存储加密,并强制密钥轮换
基于角色的访问、审计日志、可提供 BAA
按参与者导出,可配置保留窗口
按赞助方要求提供数据驻留选项(美国、欧盟)
提供适合 IRB 审查的同意与披露文件
版本化数据结构、NLP 管线版本、处理审计轨迹
授权

根据你的项目灵活提供数据访问。

Snapshot

静态数据集

一次性历史数据导出。适合探索性分析、模型训练和可行性研究。

  • Full historical cohort
  • CSV / Parquet / JSON
  • Data dictionary included
推荐
Continuous

实时数据流

持续 API 访问,每日增量更新。适用于临床监测和适应性试验设计。

  • Real-time API access
  • Daily incremental updates
  • Webhook notifications
  • SLA-backed uptime
Custom

研究合作

共同设计方案,包含自定义指标、目标队列条件和联合发表权。

  • Custom NLP pipelines
  • Targeted cohort selection
  • Joint publication
  • Dedicated data engineer
面向研究团队

获取包含 1,000 次匿名会话的样本数据集。

无需承诺。先评估数据,再讨论授权。我们会在五个工作日内为你的方案给出适配评估。