講演情報

[R1P-07]深層学習を利用したSEM-EDXスペクトルによる鉱物分類法の開発

*平井 涼聖1、瀬戸 雄介1 (1. 大阪公立大・院理)

キーワード:

鉱物分類、深層学習、EDXスペクトル

はじめに
 走査型電子顕微鏡 (SEM) とエネルギー分散型X線分光法 (EDX) を組み合わせたSEM-EDXは、鉱物科学の分野で広く普及し鉱物種の同定や化学組成の定量に用いられている。EDXスペクトルの形状は試料の化学組成だけでなく、検出器条件 (加速電圧、取り出し角、検出器ウィンドウの材質など) と試料条件 (ステージ傾斜角度、コーティング厚みなど) によって変化するため、正確な定量分析には化学組成が保証された標準物質による事前測定が必要となる。仮に正確な化学組成値が得られたとしても、ザクロ石・輝石・角閃石・雲母など複雑な固溶体を形成する鉱物の場合は、同定作業が分析者の経験に依存してしまうという現状がある。近年発達した深層学習法は、分類問題で高い性能を示し様々な分野で応用されている。ただし、EDX分析に応用するためには組成が保証された大量のスペクトルを用意する必要があり、これらを実測のみで揃えることは困難であった。そこで本研究では、任意組成のEDXスペクトルをシミュレーションし機械学習に利用する鉱物分類モデルを構築した。本手法は、元素のモル比ではなくスペクトルそのものを直接学習・判定するため、ピークの重なりを分離する必要がなく、L線などの情報も活用できるという利点がある。開発したモデルにより、実際の岩石試料から取得したEDXスペクトルを用いて、複雑な固溶体鉱物を含む実測スペクトルを高精度に分類できるか、また測定時間を短縮して計数統計誤差が増した場合にも分類精度を維持できるかを検証した。

手法
 EDXスペクトルのシミュレーションにはNISTが開発したDTSA-IIを使用した。シミュレーションパラメータ (検出器条件や試料条件) は事前に数種類の標準物質を測定し、校正した。機械学習にあたっては、まず主要造岩鉱物39種 (総端成分78種) を対象に固溶体の組成範囲を定義した。各鉱物種あたり1,000スペクトルをシミュレーションによって生成し、それらを訓練データとして分類モデルを構築した。なお、単純な分類モデルでは必ず訓練済み鉱物の中から答えを選ぶため、たとえば火山ガラスのような組成不定の物質に対しては誤った結果を出力してしまう。そこで入力スペクトルが、特徴量空間において各鉱物のクラスターからどれだけ離れているかを測り、許容範囲を超えた場合は未学習物質とする判定ロジックも加えた。検証には、角閃石黒雲母花崗岩、カンラン石普通輝石斑レイ岩、角閃石安山岩、エクロジャイトの4岩石に含まれる18種の鉱物の実測EDXスペクトルを用いた。点分析はSEM-EDX (JEOL JSM-IT300, JED-2300) により、加速電圧20 kV、照射電流0.5 nA、測定時間1、5、10、20、50秒で取得した。また、面分析は点分析と同じSEM-EDX装置・加速電圧・照射電流で行った。取得条件は倍率400倍 (視野約320×240 µm)、1024×768画素、1画素あたりの滞在時間5 msとした。この面分析データに対してピクセルビニング処理を行い、仮想画素ごとのスペクトルに対して鉱物分類を行った。正解率は、事前に画像処理によって面分析範囲内の鉱物粒子をROI指定し、ROI内に完全に含まれる仮想ピクセルが正しく分類された割合として算出した。

結果と考察
 天然の岩石試料から実測した点分析スペクトル(18種444個)対して、未学習相を検知しない分類モデルを用いて鉱物種を判定しところ、98% 以上の正解率を示し、ザクロ石・輝石・角閃石など複雑な固溶体を形成する鉱物も正しく判別ができた。一方、未学習相の検知を有効にして検証したところ、例えば化学組成が不定の安山岩中の火山ガラスを未学習相であると判定する一方で、検知無効モデルでは正しく判定ができていた石英・チタナイト・ジルコンなどの鉱物も未学習と判定されてしまう問題が生じ、正解率は 59.0 %となった。面分析では、斜長石・石英・燐灰石・ジルコンを視野に含む花崗岩試料に対して、鉱物分布マップを評価した。ピクセルビニング処理を行わない場合 (1ピクセルの分析時間5 ms) では正解率は 60.5 %にとどまり、特に斜長石の誤判定が頻発した。一方、2×2, 4×4, 8×8 (仮想ピクセル当たりの分析時間: 20, 80, 320 ms)のビニング処理を行って評価したところ、正解率は83.0 %, 96.7 %, 99.6 % となり、仮想ピクセルサイズの増加に伴って正解率も増加した。
 以上の検証の結果、鉱物種分類自体は分析時間が約100 ms以上 (合計光子カウントが約1,000以上) の実測スペクトルに対して十分に高い精度を示した。一方、未学習検知については、訓練済み鉱物の一部も未学習と判定され、正解率が下がる問題があった。これは、訓練データのシミュレーション条件が均質すぎることが原因であると考えられるため、特徴量空間における「未学習」の判定距離を最適化する必要がある。