返回市场
mcp-日文文本分析器

mcp-日文文本分析器

作者:Mistizz2 星标更新:2025-08-26

项目介绍

技术文档摘要

MseeP.ai 安全评估徽章

日语文本分析MCP服务器

这是一款能够进行日语文本形态分析的MCP服务器。从语言学的角度测量和评估文本特征,并可用于生成文本的反馈。

smithery 徽章 <a href="https://glama.ai/mcp/servers/@Mistizz/mcp-JapaneseTextAnalyzer"> <img width="380" height="200" src="https://gips3.baidu.com/it/u=3539571324,3816653155&fm=3081&app=3081&f=PNG?w=760&h=400" alt="日语文本分析MCP服务器" /> </a>

功能

  • 计算日语文本的实际字符数(不包括空格和换行符)
  • 计算日语文本的单词数
  • 对日语文本进行详细的语言特征分析(如平均句子长度、词性比例、词汇多样性等)
  • 支持文件路径或直接文本输入
  • 具有灵活的文件路径解析能力(支持绝对路径、相对路径及仅文件名搜索)

工具

目前实现了以下工具:

count_chars

计算文件中的字符数。建议使用绝对路径(Windows格式 C:\Users... 或 WSL/Linux格式 /c/Users/...)。计算实际字符数,不包括空格和换行符。

输入:

  • filePath (string): 需要计算字符数的文件路径(推荐使用Windows格式或WSL/Linux格式的绝对路径)

输出:

  • 文件中的字符数(实际字符数,不包括空格和换行符)

count_words

计算文件中的单词数。建议使用绝对路径(Windows格式 C:\Users... 或 WSL/Linux格式 /c/Users/...)。对于英文,按空格划分单词;对于日文,则使用形态分析。

输入:

  • filePath (string): 需要计算单词数的文件路径(推荐使用Windows格式或WSL/Linux格式的绝对路径)
  • language (string, 可选, 默认值: "en"): 文件的语言 (en: 英文, ja: 日文)

输出:

  • 文件中的单词数
  • 如果是日文模式,还会显示形态分析的详细结果

count_clipboard_chars

计算文本中的字符数。计算实际字符数,不包括空格和换行符。

输入:

  • text (string): 需要计算字符数的文本

输出:

  • 文本中的字符数(实际字符数,不包括空格和换行符)

count_clipboard_words

计算文本中的单词数。对于英文,按空格划分单词;对于日文,则使用形态分析。

输入:

  • text (string): 需要计算单词数的文本
  • language (string, 可选, 默认值: "en"): 文本的语言 (en: 英文, ja: 日文)

输出:

  • 文本中的单词数
  • 如果是日文模式,还会显示形态分析的详细结果

analyze_text

对文本进行详细的形态分析和语言特征分析。分析句子的复杂度、词性比例、词汇多样性等。

输入:

  • text (string): 需要分析的文本

输出:

  • 文本的基本信息(总字符数、句子数、总形态素数)
  • 详细分析结果(平均句子长度、词性比例、字符种类比例、词汇多样性等)

analyze_file

对文件进行详细的形态分析和语言特征分析。分析句子的复杂度、词性比例、词汇多样性等。

输入:

  • filePath (string): 需要分析的文件路径(推荐使用Windows格式或WSL/Linux格式的绝对路径)

输出:

  • 文件的基本信息(总字符数、句子数、总形态素数)
  • 详细分析结果(平均句子长度、词性比例、字符种类比例、词汇多样性等)

使用方法

通过Smithery安装

要通过Smithery自动安装日语文本分析器到Claude Desktop:

npx -y @smithery/cli install @Mistizz/mcp-JapaneseTextAnalyzer --client claude

使用npx运行

此包可以直接从GitHub仓库通过npx运行:

npx -y github:Mistizz/mcp-JapaneseTextAnalyzer

在Claude for Desktop上的使用

在Claude for Desktop的配置文件中添加以下内容:

Windows: %AppData%\Claude\claude_desktop_config.json

macOS: ~/Library/Application Support/Claude/claude_desktop_config.json

{
  "mcpServers": {
    "JapaneseTextAnalyzer": {
      "command": "npx",
      "args": [
        "-y",
        "github:Mistizz/mcp-JapaneseTextAnalyzer"
      ]
    }
  }
}

在Cursor上的使用

.cursor文件夹内的mcp.json文件中添加相同的设置。

Windows: %USERPROFILE%\.cursor\mcp.json

macOS/Linux: ~/.cursor/mcp.json

通用设置(适用于大多数环境):

{
  "mcpServers": {
    "JapaneseTextAnalyzer": {
      "command": "npx",
      "args": [
        "-y",
        "github:Mistizz/mcp-JapaneseTextAnalyzer"
      ]
    }
  }
}

在Windows环境中,如果上述设置不起作用,请尝试以下设置:

{
  "mcpServers": {
    "JapaneseTextAnalyzer": {
      "command": "cmd",
      "args": [
        "/c",
        "npx",
        "-y",
        "github:Mistizz/mcp-JapaneseTextAnalyzer"
      ]
    }
  }
}

使用示例

直接计算文本的字符数

请计算这段文本的字符数。

以日语模式计算文件的单词数

请以日语模式计算 C:\path\to\your\file.txt 的单词数。

以WSL/Linux格式的路径计算单词数

请以日语模式计算 /c/Users/username/Documents/file.txt 的单词数。

仅通过文件名计算单词数

请以英文模式计算 README.md 的单词数。

将文本粘贴并计算日语单词数

请计算以下文本的日语单词数:

吾輩は猫である。名前はまだ無い。どこで生れたかとんと見当がつかぬ。何でも薄暗いじめじめした所でニャーニャー泣いていた事だけは記憶している。

分析文本的详细语言特征

请详细分析以下文本:

我昨天买了一本新书。这是一本非常有趣的小说,朋友的评价也很好。我计划这个周末慢慢读它。

分析文件的详细语言特征

请详细分析 C:\path\to\your\file.txt。

文件路径解析功能

该工具在指定文件路径时具有灵活性:

  1. 如果指定了绝对路径,则直接使用
    • Windows格式的绝对路径(例如:C:\Users\username\Documents\file.txt
    • WSL/Linux格式的绝对路径(例如:/c/Users/username/Documents/file.txt),会自动检测并转换
  2. 根据当前目录(工作目录)解析相对路径
  3. 根据用户主目录(%USERPROFILE%$HOME)解析
  4. 根据桌面目录解析
  5. 根据文档目录解析

这意味着,即使只指定“README.md”这样的文件名,也会在一些常见目录中自动搜索文件,找到后即可使用。此外,从WSL环境或Git Bash获取的路径(如/c/Users/...格式)也可以在Windows环境中直接使用。

内部操作说明

此工具使用“kuromoji.js”这一形态分析库来计算日语文本的单词数。形态分析是自然语言处理的基础步骤,将文本分解为有意义的最小单位(形态素)。

形态分析的初始化可能会花费时间,尤其是需要加载词典数据时,首次运行时可能会稍有延迟。通过在服务器启动时初始化形态分析器,可以尽量减少工具运行时的延迟。

语言特征分析

“analyze_text”和“analyze_file”工具基于形态分析的结果计算文本的各种语言特征,包括但不限于:

  • 平均句子长度:每个句子的平均字符数。数值越大,文本越难读。
  • 每个句子的形态素数量:每个句子的平均形态素数,反映了句子的密度和语法复杂度。
  • 词性比例:名词、动词、形容词等词性在文本中的使用比例。
  • 助词比例:特定助词的使用频率,用于分析句子结构和流程。
  • 字符种类比例:平假名、片假名、汉字、英数字的构成比例。
  • 词汇多样性:不同单词数与总单词数的比例(类型/标记比),衡量词汇丰富度。
  • 片假名词的比例:片假名词的使用频率,反映外来词和专业术语的多少以及文体的随意程度。
  • 敬语频率:敬语表达的使用频率,衡量文本的礼貌程度和正式程度。
  • 标点符号的平均数量:每个句子的平均标点符号数量,提供关于句子分隔和易读性的指标。

通过组合这些指标,可以从多个角度分析文本特性,评估文体、易读性和专业性等。

许可证

此MCP服务器在MIT许可证下提供。这意味着,在遵守MIT许可证条款的前提下,您可以自由地使用、修改和分发该软件。详情请参阅项目存储库中的LICENSE文件。