統計的手法
現在、予測サービスはProphetをサポートしており、ほとんどのデータで効率的かつ確実に動作することが示されています。 Prophetは、Metaによって開発されたオープンソースの予測パッケージです。 データをトレンド、季節、イベントの要素に分解します。 預言者モデルは効率的で、多くの予測アプリケーションに合わせて適切に拡張します。 さらに、モデルは外れ値や欠落データに対しても効果的です。
将来的には、ヒューリスティクスに基づいてモデルを選択する計画があります。例えば、ストリーミングデータに対するオンライン近似ガウス処理、ユーザーが最適な予測精度を指定し、長い待ち時間に耐えることができる場合のNeuralProphetを選択します。
データポイントが多すぎると、サービスは自動的にデータをダウンスケールし、応答時間を確保します。 目標応答時間は約3秒に設定されています。 現在、データポイント数が5500を超える場合、時系列データはデータ長に応じて適応的にダウンサンプリングされます。 出力は元のデータ周波数に戻されるため、アダプティブサンプリングプロセスはユーザーエクスペリエンスに影響を与えません。
複数年のデータが利用可能な場合、休日の影響が考慮されます。 現在、考慮されている休日のリストは次のとおりです。
- マーティン・ルーサー・キング・デイ
- 大統領の日
- 記念日
- 4 年 7 月(PT)
- 感謝祭
- Black Friday
- Cyber Monday
- クリスマス
また、シックスシグマ範囲外のデータポイントを削除するなど、単純な異常値(異常値)の削除も実行できます。 これは、すべてのデータポイントが有効であると仮定されるため、デフォルトでは有効になっていません。 異常値は、一般的に予言者モデルが異常値に対して回復力を持つとしても、モデルの品質に悪影響を与える可能性があります。
このサービスは、ユーザーが指定した季節設定(毎日や毎週の季節設定など)を受け付けます。 それ以外の場合、モデルは自動的に季節性を選択します。 データの精度が異なれば、このサービスはさまざまな長さの履歴データを使用して予測モデルを構築します。 例えば、日次データの場合、1年以上のデータが取得されます(使用可能な場合)。 時間単位のデータの場合は、8週間のデータが取得されます(使用可能な場合)。 データを取得するのは時間がかかり、時には待ち時間が長くなることもあります。
異なる時間の精度に必要な履歴データ:
指定された各時間の予測結果には、予測区間(下限と上限で定義)が含まれ、将来の観測値が95%含まれることが期待されます。この区間は信頼区間と呼ばれます。 サービスの将来の予測に制限はありません。 しかし、予測の不確実性は、時間の経過とともにより広い予測間隔によって反映され、将来の日付とともに増加します。
このサービスは、ユーザーデータに関する仮定を一切行っていません。 例えば、サービスは、データが負でないことを前提としません。 これは、観測されたデータポイントがすべて負ではないにもかかわらず、データが強い下降傾向を示す場合、予測とその境界が負になる可能性があることを意味します。
参照
- Taylor、Sean J.、Benjamin Letham: 大規模な予測 アメリカ統計局72.1 (2018):37-45
- Triebe, Oskar, et al.: Neuralprophet:大規模な説明可能な予測 arXiv プレプリント arXiv:2111.15397 (2021)。
- Zhang and Arbor: 時系列異常値検出。 米国特許出願#18/057883。