第三者製AIヒューマナイザーのテストの読み方
入力と出力を印刷する機能は、検証可能な証拠を提示する。評決の一部はページから再構成でき、一部はページが再現可能にしていない資料や判断に依存する。両者を見分けることが有用な技術である。
HumanPen チーム
· 10 分
短い答え
公開されたテストを二度読むこと。一度目の通読でレビュアーが下した結論が分かる。二度目は、ページに印刷された証拠からどのような結論に至れるかを問う。2026年8月のTom's Guideの記事では、一つの発見が直接検証できる: リライトツールが「少なくとも15,000年前」を「数世紀前」に変え、両方の文が印刷されている。リズムと自然さに関する判断は異なる。それに同意することはできるが、記事はその判断を別のファイルに適用するための明示された規則を示していない。
記事は 人気のAIヒューマナイザーをテストした — そして私の文章はずっと悪くなった、Amanda Caswell著、2026年8月21日公開。2026年8月28日にページを確認した。以下に記事に帰属する引用はすべてそのレンダリングされた記事からのものである: HumanPenセクションの引用はファーストパーティの製品ページテキストとして識別される。
何より先に一つ明示すべきことがある。我々は文書リライトツールを販売しており、したがってこのカテゴリーがどう語られるかに利害を持つ。その関心を視野に入れておくこと。以下の集計は別の出版物が印刷した段落を用いており、我々を信頼せずにやり直せることを意味する。
テストが実際に何であったか
記事は読者が一つの前後例を検証できるよう、設定の十分な部分を印刷している。
- ソーステキストは生成されたものである: レビュアーは「ChatGPTに犬の家畜化に関する短いエッセイを書かせ」、そのエッセイの導入部が全文印刷されている。単純な空白分割で65語である。
- その一つの段落がリライトツールに通され、返却された三つのバージョンが全文印刷されている: GrammarlyのHumanizer、Rehumanize.io、Ace.aiである。
- ページでは二つの検出器、GPTZeroとPangramが名指しされ、一つの評決が報告されている: PangramがAce.aiの出力をAI生成と判定した。
- 記事は「複数の」ツールが試されたと言い、より技術的な内容でテストを実行した際「ベンチマークスコアとバージョン番号を伴って」同じ問題が現れたと言う。それらの追加実行は記述されているが印刷されていない。
したがって可視コーパスは四つの段落である: 一つの入力と三つの出力、すべて同一の主題ですべて英語である。これは小さな証拠だが検証可能である。ページは実行がいつ行われたか、どれほど時間がかかったか、使用された設定を明らかにしていない。
三つの発見、そしてそれらは同じ種類のものではない
記事は三つの問題を報告しており、それらはどこかに持ち出そうとすると全く異なる振る舞いをする。
| 記事が報告すること | ページが検証用に提示するもの | 自ら再構成できるか? |
|---|---|---|
| 「the rhythm became choppy and unnatural」(リズムがぎこちなく不自然になった) | 四つの段落、全文印刷 | ページに示された固定規則によるものではない。四つすべてを読んで自分の見解を持つことはできるが、記事はその判断を別の文書に適用するための採点規則を公表していない |
| 「the tools changed facts or stripped away important context」(ツールは事実を変えるか重要な文脈を削除した) | 入力文と出力文、ともに逐語的 | 可能である。二つのテキストには直接検証可能な事実の変更が一つ含まれる |
| 「processing a draft through a humanizer actually increased its probability of being flagged」(下書きをヒューマナイザーに通すことは実際にフラグされる確率を高めた) | 一つの文、加えて一つの出力に対する検出器の評決 | 部分的に。単一の評決は述べられている。その背後にある複数の実行は印刷されていない |
検出器の結果はこの記事の主題の外であり、第三の行に何も構築しない。それは証拠の境界を示すために含まれている: ページは一つの評決を報告するが、より広範な文の背後にある他の実行は印刷されていない。その文を率に変えるべきではない。
再構成できる一つの発見を再構成する
私の規則を示すことで、読者はそれに異を唱えることができる。数字トークンとは、`\d[\d,]*`のパターンで見つかる、内部にカンマを含みうる最大の数字の連続である。コーパスはそのページに印刷された四つの段落のみである。数字トークンが生き残るのは、同一のトークンが対応する出力のどこかに現れる場合である。意味は判断せず、文字列を照合した。
入力: 「遺伝学的および考古学的証拠は、犬が少なくとも15,000年前に古代のオオカミの集団から下ったことを示唆している。」 · Rehumanize.io出力: 「遺伝学と古い発見に基づけば、犬は数世紀前に古代のオオカミのグループから来たようである。」 記事自身の一文: 「我々は15,000年から'数世紀'へと至った。」
入力段落には二つの数字トークン、`15,000`と`30,000`が含まれる。三つの印刷された出力は、この二つのトークンが戻る機会を六つ与え、うち五つが戻った。戻らなかった一つはRehumanize.io出力の`15,000`であり、これが記事が名指すドリフトである。他の二つの出力は両トークンを返した。同じ抽出段落での感度チェック: `dogs`の大文字小文字を無視した完全一致カウントは各段落で二つの一致を返し、したがってチェックは一つで止まらず四つすべてを読んでいた。
さて、その数字に関する正直な部分である。六つは二つの数字×三つの印刷出力であり、すべてページに示された65語の入力一つから派生したものである。それは公開日を持つ記事で報告された一つの名指し例を検証するものである。率やランキング、自分のファイルに対する予想には全く足りない。記事から持ち出すべき一文はレビュアー自身のものである: 「出力は元の文章と行ごとに照合せずに信頼することはできない。ツールが節約しうる時間はすぐに消え去る。」
なぜこの種のエラーが校正を生き残るのか
「数世紀前」はタイプミスではない。文法的であるが、そこなされる主張はソース文の主張ではない。スペルチェックはそれらの主張を比較しない。正確な前後比較はそうする。
ページは三つのツールが内部でどう機能するかを明かさず、したがってこの変更がなぜ起きたかを教えることはできない。可視ペアが示すのはより狭い: 文が文法的なまま、特定の値が広い時間ラベルになった。レビュアーはベンチマークスコアとバージョン番号をさらなる二つの例として挙げ、「データのような詳細は特定の言葉がそうであるようには交換可能ではない」と書く。学術文書では、同じ比較はサンプルサイズ、p値、用量、条文と節番号、日付、引用符内の言葉、引用内の著者-年のペアを含みうる。
この例では、変更を捉える直接の方法は返却された文をソースと比較することである。リスクのより広い地図が必要なら、AIヒューマナイザーにおける引用、表、数式に何が起きるかが別途チェックが必要な要素を扱う。すでに誤って返却された場合は、AIヒューマナイザーが私の論文を壊した? 引用と書式を復元するが復元の順序を扱う。
機能テストがあなたの文書について語れないこと
雑誌の特集記事はベンチマークではなく、そう主張したこともない。ゆえにこれは不満ではない。記事を誰かに—自分自身にも—引用する前に頭に入れておくべきリストである。
- 率。 一つの段落、三つの印刷出力。「N%のツールがこれをする」を支分母ここにはない。
- 別のツールがどう振る舞うか。 可視的な前後比較は三つの製品を名指しする。ページに示されていない製品がどう振る舞うかを確定することはできない。
- 文書に何が起きるか。 印刷された四つの段落には脚注、番号付き表、相互参照、参考文献リストがない。記事は技術的コンテンツの追加実行に言及するが印刷せず、ゆえに可視コーパスはファイル層の問いに答えられない。
- 可視実行がいつ行われたか。 2026年8月21日は記事の公開日である。ページは製品実行の日付を明かさず、したがって出力をその日に固定できない。
- あなたの言語で何が起きるか。 四つの段落はすべて英語である。
それが与えるのは、製品ページではなく第三者の出版物からの証拠である: 可視的な事実の変更を伴う印刷された前後である。それはチェックを構築するには十分だが、リーダーボードにはならない。文書書式の主張とダウンロード可能なテストデータを対象とした別の手法については、AIヒューマナイザーの「書式を維持する」という主張を検証する方法を参照。
公開された例を自ら再検証する
いかなるツールにもテキストを送信せずに上の集計を再現できる。これは記事が印刷するものを検証するのであり、そのより広範な評決の背後にある非印刷実行ではない。
- 記事を開き四つの印刷段落を見つける: 犬の家畜化の入力と、Grammarly、Rehumanize.io、Ace.aiの出力である。
- 宣言された規則でソースの数字トークンを抽出する。 すなわち、内部にカンマを含みうる最大の数字の連続である。入力は`15,000`と`30,000`を与えるはずである。
- 各出力にそれらの正確な文字列があるか確認する。 二列の格子に存在または不在を記録する。それはパーセンテージではなく六つのセルを作る。
- 非印刷の主張は別の列に置く。 技術コンテンツの実行、製品の設定、実行日付、検出器の値は記事で報告されるが、可視段落からは再構成できない。
格子は五つの存在セルと一つの不在セルを含むはずである。そうでない場合は、結論を出す前に段落のアンカーとトークン規則を比較すること。自らの文書をテストするには、別のファイルレベルのプロトコルを用いる: AIヒューマナイザーの「書式を維持する」という主張を検証する方法は意図的に難しいサンプルを扱い、提出前にヒューマナイズされたWord文書をレビューする方法は返却されたファイルを扱う。
境界が引かれる場所
冒頭で利害を宣言したので、ここにファーストパーティの部分を示す。自社ページが述べるものに限定する。HumanPenはテキストボックスではなくファイルを受け取り、スコープは何かを実行する前にユーザーが設定するものである: 段落を直接追加するかTurnitinやiThenticateのレポートをインポートでき、ページは段落がエンジンがリライトする最小単位であると表明しており、したがって一つの一部を含む選択は「is expanded to the full paragraph and shown that way for you to confirm. Everything else is left untouched.」 (段落全体に拡張され、確認できるようにそのように表示される。それ以外はすべてそのまま残される。) スコープ内のものに対する表明された目標は「preserve meaning, structure, terminology, citations, layout, and styles while rewriting only the necessary language.」 (必要な言語のみをリライトしつつ、意味、構造、用語、引用、レイアウト、スタイルを維持する。)である。適格な結果は引き続きAIを無料で低下させることができる。
これは境界がどこにあるかの記述であり、その内側に何が戻るかについての主張ではない。自社のFAQは該当する答えを「Review complex documents after download,」 (ダウンロード後に複雑な文書をレビューすること。)で締めくくるが、この一文全体がそれへの論証であるため、私はこの一文を削除してほしくない。
ワークフローの何ものも上のステップ4を取り除かない。スコープが小さいことは比較すべき段落のリストが短いことを意味し、代替が論文全体である場合には真の節約になる。それはスコープ内にあった段落の比較を飛ばす理由ではない。
よくある質問
Tom's Guideのテスト全体を検証したか? いいえ。可視的な前後を再構成し、宣言された`15,000`から「数世紀」への変更を見つけた。ページは他の技術実行、設定、日付、検出器の値を印刷せず、ゆえに本記事は特集のそれらの部分を監査しない。
なぜレビュアーの全体的評決をそのまま繰り返さないのか? 可視的な入力は引用、表、参考文献リストのない65語の生成エッセイ導入部であり、一方で記事は印刷しない技術実行にも言及するからである。印刷された事実の変更は独立して検証できる。より広範な評決は、より大きく一部しか非公開でない実行の集合に関するレビュアーの報告のままである。
これは数字が常に変更されるという意味か? いいえ。ページ上の六つの数字の返却のうち五つはそのまま戻った。可視例はこの種の変更が一度生じ、正確な比較がそれを捉えることを確立する。通常の読書がそれを捉えるか、問題が一般的か稀かは確立しない。
自分のファイルをテストしたい場合どこから始めるか? 上にリンクされた書式維持の別プロトコルを用いること。それはすでに意図的に難しいサンプルの構築と返却されたアーティファクトの比較を扱っており、一方このページは一つの公開された特集に印刷された証拠の再構成にとどまる。
このようなテストを読んだ後、ベンダーに何を尋ねるべきか? 自分のもののような資料から作られた前後を求め、次に例が可視的に証明することをベンダーがそれについて述べることから切り離す。集計が現れた場合は、何が数えられたか、分母は何だったか、どの規則がその数字を生成したかを尋ねる。
続きを読む