DataScore

2026-05-08

更新说明

<2026.05.08> / <v0.8.3>

更新类型
具体更新
功能新增
功能优化
更新了多表单识别和处理功能,可识别多sheet Excel
1. 大幅度精简架构,提速;2. 功能分支的路由逻辑改为模型自主决定的决策,由用户问题(主要权重)+模式选项卡(次要权重)综合控制;3. 保留了数据收集、分析策略、数据清洗策略、宏观评价、自由问答五个分支,并预留了更多细分场景的升级空间

一、产品介绍

1.1 产品概述

DataScore 将您多年积累的临床数据进行全景式质量评估与前瞻性研究潜力分析,智能输出数据治理方案与科研价值预测,让沉睡的数据转化为可驱动前沿研究、发表高影响力成果的学术引擎。

功能总览

功能
具体说明
输出内容
数据资产透视
从完整性、一致性、准确性、时效性等多个维度,对数据集进行全面深入的"健康体检"
数据质量报告、数据优势与短板分析
研究潜力预测
通过先进算法模型,分析数据可支撑的科研课题级别,量化研究成果可达高度
研究潜力评估报告、成果预期与方向建议
数据治理导航
针对识别出的数据短板,提供具体、可执行的补强策略与治理路径
数据治理方案、采集标准优化建议、清洗整合路径

1.2 产品优势

  1. 多维度数据质量评估

DataScore 对数据集进行多维度质量检测,自动生成数据质量报告,帮助您全面了解数据现状,为后续研究奠定基础。

  1. 研究潜力评估

系统基于数据特征分析其可支撑的科研课题级别,量化预期研究成果,辅助您在立项阶段明确研究方向,合理规划研究投入。

  1. 数据治理建议

识别数据短板后,DataScore 提供具体的数据补强与治理方案,包括补充缺失变量、优化采集标准、数据清洗与整合路径等,帮助您系统性提升数据质量。

1.3 典型应用场景

场景一:手握海量数据,不知从何下手

  • 您面临的挑战:您作为科室主任或课题组负责人,多年来积累了上千例患者的临床数据,直觉告诉您这里面蕴藏着巨大的价值。但数据格式不一、记录散乱,部分字段缺失严重,形成了一个“沉睡的数据孤岛”。您想启动一项高水平研究,却不知该从哪个角度切入,更不确定现有数据能否支撑起您的雄心壮志。
  • DataScore的解决方案:您只需要选择“数据评估报告”这个功能,再上传待评估的病历报告表数据,DataScore 会通过 “临床数据科学五维(VITAL)综合测评”,从基础数据质量(CLUES)和科学生命力(VITAL)两大维度给出评分,明确数据在样本量、终点可用性等方面的优势,同时提供针对性应用策略,还会提示需规避的问题,最后推荐数据适配的研究类型,为您启动研究提供清晰、全面的依据。

场景二:研究初期设计卡壳,数据收集无清晰方向

  • 您面临的挑战:您是一位正在攻读博士学位的研究生,计划开展一项基于回顾性数据的临床研究,目前刚进入研究设计阶段。但在核心的数据收集环节陷入困境:不清楚该围绕研究假设设计哪些关键表头,也不明确数据记录的规范格式,担心因前期表头设计不合理,导致后续收集的数据遗漏关键信息、无法支撑分析需求,甚至要推翻重来,严重影响研究进度,急需专业指导搭建科学的数据收集框架。
  • DataScore的解决方案: 您只需选择“数据收集助手功能”并上传现有临床试验数据集,DataScore 将结合 SPIRIT、CONSORT 国际规范,快速分析现有字段价值、识别缺失缺陷,为您明确需增补的关键字段(如既往病史、CTCAE 标准化 AE 记录等),并提供表头规范、数据格式统一、质量控制流程等可落地建议,帮您搭建符合 I 期试验需求的完整数据收集框架,确保数据支撑后续研究与规范报告。

场景三:研究假设待深化,创新方向需数据支持

  • 您面临的挑战:您基于临床数据开展回顾性研究,已通过初步数据评估确认现有数据质量达标、能支撑核心研究假设,且已完成基础数据清洗工作。但当前仅能想到 1-2 个常规分析角度,担心研究方向缺乏创新性,难以产出高水平成果;同时不确定如何通过更深度的数据分析验证假设的延伸价值,也希望获得专业的研究设计优化建议,让研究结论更具说服力和学术竞争力,却不知从何切入深化分析。
  • DataScore的解决方案:您只需选择“数据洞察专家” 功能,并上传肺癌患者特定靶向治疗响应数据集,DataScore 会先精准定位研究领域为肺癌治疗响应领域,再基于数据变量(如遗传标记状态、无进展生存期等)生成 2 个科学选题(含遗传标记对治疗响应的影响评估等),同时明确适合的研究类型为回顾性队列研究,并梳理关键分析字段及模块;此外,还会提出整合外部数据以增强研究支撑力的追问建议,帮您清晰把握研究方向与可行路径。

二、快速开始

2.1 任务目标

我们将帮助您完成一次临床数据表的深度挖掘和探索,通过本次任务您能立即掌握使用DataScore的使用方法,这是让DataScore成为您的得力科研助手的第一步。

2.2 准备工作

您需要准备一个有效的梅斯账号和一份包含多个字段和多条记录信息的临床数据记录表(支持xlsx、xls、csv、docx等格式)。字段内容不限(越完整越好)。为了保障运行速度,初次尝试时建议把有效样本量控制在400例以内。

2.3 步骤一:新建临床数据处理任务

通过网址https://ai.medsci.cn/zh/datascore-base进入DataScore工作区,先点击“新建对话”,在“新会话”中点击附件上传按钮,上传您的数据记录表,请注意,我们不推荐未经过格式化的word文档,这可能导致运行不稳定或误读,此外,若您上传的Excel表格有多个页面,DataScore只会分析第一个页面的数据。上传数据成功后,您将在页面中看到您已经成功上传的文件。选择对应的功能选项卡,在对话框中输入任何科研想法。如果一时想不出也没关系,输入一个科研目标、一个疾病主题、或一个清晰简洁的指令(如“开始”)均可。

飞书文档图片

DataScore提供的功能有:(1)Chat模式,这是默认模式,可根据您的提问匹配数据收集、快评报告等功能,遵循功能切换规则,适合新用户探索。(2)数据收集助手,这是不限次使用的工具,支持临床数据收集、研究设计相关需求,需带附件表格+输入相关问题启动,换表需手动切菜单。(3)数据评估报告,通过这个功能,您可以对临床数据做1次质量快评(单个会话),辅助数据清洗与分析设计,普通用户友好,完成后可无缝对接其他功能。(4)数据洞察专家,这个功能支持1次完整报告+3轮研究方向交互,专业度高适合有研究功底用户,未做快评需先评估数据质量,暂不支持上传无关文件。

2.4 步骤二:获得数据评估的结果

以数据评估报告为例,在文件上传成功后,您只需等待一会儿(大约2-4分钟),即可收到一份结构完整、包含五大章节的深度数据评估报告!

首先,在第一章:数据质量量化评估概要中,报告会基于“C-L-U-E-S”基础五维数据质量评估体系对数据集进行深度扫描。您将看到一个直观的量化评分表和一个CLUES评估雷达图。评分表详细列出了数据集在完整性、可控性、实用性、延展性、数据规模五个维度的具体分数、星级评定及核心评价;结合雷达图,帮您一目了然地掌握数据集的基础质量水平、综合分数与整体适用场景。

飞书文档图片

接着,第二章:样本适配度描述会从临床研究与统计学角度出发,明确指出该数据集最适合的研究类型。该章节不仅会详细阐述适配理由,还会客观提供局限性提示,助您精准把控数据最适用的科研方向。

飞书文档图片

第三章:数据优化策略中,报告为您量身定制了分层的优化路径,将为您进一步提升科研产出质量提供清晰的实操指南。

飞书文档图片

随后,第四章:维度分级理由深度分析会对首章的CLUES各维度得分进行逐一且深度的拆解,让您对数据的底层价值与操作边界有更透彻的理解。

飞书文档图片

最后,在第五章:小结中,您将获取到对整份数据表核心价值的高度凝练。该小结包含了最终分析结论、最适配研究类型、致命缺陷提示及核心优化策略,并附带针对性的专家寄语,为您的研究规划指点迷津。报告末尾还提供了后续操作的使用提示,引导您切换至“数据洞察专家”功能,以便结合自身研究思路开启更深度的个性化科研交流。

飞书文档图片

2.5 步骤三:提升您与数据的契合度

当DataScore给出初步的数据评估结果和应用策略后,您可以根据您感兴趣内容或疑惑的问题类型切换到“数据洞察专家”或者“数据收据助手”进行多次追问,DataScore将与您展开一场酣畅淋漓的头脑风暴。

飞书文档图片

首先,DataScore会根据您的提问分析研究领域并定位问题,对现有的数据内容进行价值分析,然后精准回答您的问题,助力您高效利用数据。此外,DataScore还会通过提取您对数据使用的需要来进一步生成更有针对性的数据优化方案,根据优化建议您可以更精准地规划数据的处理和更新。

飞书文档图片
飞书文档图片
飞书文档图片

2.6 任务完成!

恭喜您!通过几步即完成了一份数据集的质量评估和价值探索工作,并获得了一份完整的数据分析与应用报告。现在,您可以根据这个报告进行后续的探索和研究!

💡
提示:内容为AI检索及生成,应用需经过人工核验。

三、进阶技巧

3.1 指令构建的黄金法则

法则一:提供角色与背景

明确告诉DataScore需要扮演的角色及任务背景,使其能更好地理解您的需求。

【示例】

  • “作为一位专业的医学数据分析师,请评估我的数据集质量。”
  • “你是一位科研项目指导专家,请为我设计一个基于现有数据的研究课题。”

法则二:设定清晰的约束

在指令中明确输出内容的范围、格式和其他约束条件,以确保生成结果符合您的实际需求。

【示例】

  • “请生成一份不少于500字的《数据资产价值报告》,重点分析数据完整性和一致性。”
  • “请为我推荐3个研究方向,并确保每个方向都基于数据的高质量部分。”

法则三:聚焦具体的目标

避免广泛或模糊的指令,确保任务目标清晰且具体。

【示例】

  • 不佳指令:“帮我分析一下数据。”
  • 优化后:“请基于我的数据集,分析与‘糖尿病并发症预测模型’相关的变量质量,并提出优化建议。”

法则四:善用追问与迭代

如果初次生成结果不理想,可以通过追问或补充信息进行迭代优化。

【示例】

  • “请进一步分析随访数据完整度对研究成果的影响。”
  • “请扩展第一个研究方向的细节,并提供初步的研究设计框架。”

3.2 实战演练:从“新手”到“专家”

场景: 利用数据收集助手功能科学设计数据框架。

新手指令: “我要做肺癌研究,帮我设计数据收集的表头。”

专家指令: “作为肺癌临床研究数据设计师,请基于我计划开展的‘非小细胞肺癌靶向治疗回顾性研究’,设计数据收集表头:1. 表头需覆盖‘患者基线信息(年龄、病理分期)、靶向药类型(EGFR-TKI/ALK 抑制剂)、治疗响应评估(RECIST 标准)、不良反应分级(CTCAE 5.0)’4 类核心模块;2. 每个字段需标注数据类型(数值型 / 分类型)及填写规范(如‘病理分期’需按‘Ⅰ/Ⅱ/Ⅲ/Ⅳ 期’填写);3. 提示可能遗漏的关键字段(如‘吸烟史’对靶向治疗响应的影响);4. 需符合《临床研究数据管理规范》要求。”

效果对比分析: 新手指令仅明确 “研究类型”,表头设计易缺失关键模块;专家指令通过 “角色(设计师)、研究细节(疾病亚型 / 治疗方式)、字段规范(类型 / 填写标准)、合规要求”,让数据收集助手输出可直接落地的表头,避免后续数据补录。

四、常见问题与使用建议

若在使用产品过程中遇到问题,可以参考此文档。

4.1 常见问题(FAQ)

问题
解答
数据安全吗?
采用先进的信息脱敏技术,处理过程及输出结果均符合国家数据安全管理相关规范。
生成内容是否原创?
融入创新思维方法与多层推理技术,精准捕捉符合生物医学逻辑的潜在创新点。建议配合 LitraX 或 NovaX 结合文献调研进一步判断研究创新层次。
为什么数据无法评估?
常见原因:文件格式不支持、数据不完整或字段错误。优先推荐 xlsx、csv 格式;也支持储存结构化信息的 txt、docx 等文档。含表格的 pdf 或图片可能出现识别误差,不建议上传含大量表格的 word 文档。
如何理解数据质量评分?
综合梅斯医学多年数据治理经验自主开发的评分标准,通过精准分级、动态赋分,形成数据-需求有机联动,旨在帮助研究者理解数据特质并提供有效应用策略。
支持哪些数据格式?
优先推荐 xlsx、xls、csv;支持 txt、word 等文字文件。含表格的 pdf 或图片可能出现识别误差,请谨慎使用。

4.2 最佳实践

✅ 推荐做法
❌ 避免做法
数据完整:上传前检查数据集的完整性与一致性,提高分析准确性
格式错误:避免上传不完整或格式不当的数据,上传前做好格式检查与数据清理
格式规范:优先使用 xlsx、csv、txt、word 等常见格式,确保系统正确读取
超大文件:初次使用建议控制有效样本量在 400 例以内,保障系统稳定与速度
目标明确:附上明确的研究目标或问题描述,帮助系统识别潜在研究方向
忽视短板:对评估报告指出的数据短板及时采取改善措施,不拖延
迭代优化:结合评估报告建议优化采集策略,定期更新维护数据集
盲目依赖:默认分析结果为初步建议,需结合自身研究需求深入分析与个性化调整

4.3 故障排查

若输出结果不理想,请:

  1. 检查数据:上传数据是否符合支持格式?字段与记录是否完整一致?
  2. 优化输入:是否提供了明确的研究目标或背景信息?补充细节帮助系统准确识别。
  3. 按报告调整:根据评估报告建议,调整数据采集和整理策略,改善数据质量后重新上传。
  4. 联系支持:问题仍未解决,请联系梅斯医学 DIEC 团队获取专属指导。