产品定位
WordStat 是 Provalis Research 推出的计算机辅助内容分析与文本挖掘软件,兼具易用性与专业性:既可以通过文本挖掘快速提取主题与趋势,也能借助定量内容分析工具进行严谨精确的测量。它可与同厂的统计软件 SimStat、定性分析软件 QDA Miner 以及 Stata 无缝集成,将非结构化文本与结构化数据关联分析。
核心功能
- 多源数据导入:支持导入 Word、Excel、HTML、XML、PDF、SPSS、Stata、NVivo 等文档与数据文件,也可接入社交媒体、电子邮件、网络问卷平台和文献管理工具,并支持多语言(含从右到左书写的语言)文本。
- 文本挖掘探索:借助聚类、多维尺度分析、邻近图与链接分析,从海量非结构化数据中快速提取高频词、短语与核心主题,处理速度可达每分钟约 2500 万词。
- 主题建模:基于自然语言处理与统计分析自动提取文档集合中最显著的主题,覆盖单词、短语及相关词(含拼写错误)。
- 词典分类:使用现成词典或自建分类模型,支持布尔(AND/OR/NOT)与邻近(NEAR/AFTER/BEFORE)规则及正则表达式,实现全文分析自动化。
- 机器学习分类:采用朴素贝叶斯与 K 近邻算法构建并优化文档自动分类模型,支持留一法、n 折交叉验证等验证方式。
- 文本与结构化数据关联:通过对应分析、热力图、气泡图及多种统计关联度量,识别时间趋势、子群差异及文本与数值/类别数据的关系。
应用场景
适用于开放式问卷与调查回应分析、商业智能、新闻报道内容分析、欺诈检测等场景。用户可一键从图表返回原始文档(关键词检索、上下文关键词)以验证或深入挖掘,并可结合 GIS 地图、命名实体抽取与 Python 脚本扩展分析能力。
产品优势
- 入门友好:提供面向新手的经验模式,一键提取高频词、短语与主题。
- 生态集成:与 SimStat、QDA Miner、Stata 打通,兼顾定性编码、统计分析与文本挖掘。
- 分析闭环:从导入、挖掘、分类到回源验证形成完整流程,结果可导出为 Excel、SPSS、HTML、XML、Word 及多种图片格式。
展开
收起